En Valarn, somos agnósticos en cuanto a modelos.
Eso significa que no estamos atados a un solo modelo de IA. Usamos el modelo que le brinda a nuestros usuarios la mejor investigación.
Para asegurarnos de que estamos utilizando las herramientas adecuadas, comparamos regularmente los últimos modelos de IA.
A principios de este año, comparamos GPT-4o y Claude Sonnet utilizando 500 tareas de investigación financiera idénticas.
Una nota importante: este es un benchmark interno, no un estudio académico. Estos resultados reflejan nuestras pruebas y deben ser vistos como una guía útil, no como una verdad absoluta.
Cómo probamos#
Utilizamos 500 escenarios de investigación históricos, incluyendo:
- 200 grandes empresas de EE. UU.
- 150 empresas medianas de EE. UU.
- 100 ETFs sectoriales
- 50 empresas internacionales
Cada análisis se realizó utilizando los mismos prompts y la misma información histórica. Debido a que ya sabíamos lo que sucedió después, pudimos comparar la investigación de cada modelo con el rendimiento posterior del mercado.
Qué medimos#
Examinamos varias áreas:
- Con qué frecuencia la perspectiva general del mercado coincidía con la dirección posterior del mercado.
- Qué tan bien la IA explicaba su razonamiento.
- Con qué frecuencia presentaba información incorrecta o inventada.
- Si sus puntajes de confianza coincidían con su rendimiento real.
Resultados generales#
| Modelo | Precisión a 30 días | Precisión a 90 días |
|---|---|---|
| GPT-4o | 62.1% | 58.4% |
| Claude Sonnet | 64.8% | 61.7% |
Ambos modelos funcionaron bien, pero Claude Sonnet obtuvo consistentemente puntajes más altos en nuestras pruebas.
La confianza importa#
Una cosa destacó.
A medida que Claude Sonnet se volvía más confiado, su investigación generalmente se volvía más confiable.
GPT-4o no siguió el mismo patrón. De hecho, sus análisis de mayor confianza eran a veces menos confiables que aquellos con una confianza ligeramente inferior.
Eso es importante porque la confianza debería significar algo.
Calidad del razonamiento#
Tres analistas senior revisaron cada informe.
Buscaron:
- Explicaciones claras
- Fuerte uso de datos de apoyo
- Pensamiento lógico
- Discusión honesta sobre la incertidumbre
- Consideración de diferentes puntos de vista
En general, Claude Sonnet produjo investigaciones más equilibradas y mejor respaldadas.
GPT-4o a menudo proporcionaba respuestas muy detalladas, pero algunos detalles sonaban más ciertos de lo que la evidencia disponible respaldaba.
A veces, ser más detallado no significa ser más preciso.
Alucinaciones#
Esta fue la mayor sorpresa.
Una alucinación ocurre cuando una IA presenta información incorrecta como si fuera verdadera.
En nuestras pruebas:
- GPT-4o: 8.3% de los informes contenían al menos un dato incorrecto.
- Claude Sonnet: 3.1% de los informes contenían al menos un dato incorrecto.
Eso es casi una diferencia de 3×.
Para la investigación financiera, esto importa.
Un único número de ganancias incorrecto o métrica financiera puede cambiar toda la conclusión de un análisis.
Preferimos que una IA diga "No sé" que proporcionar con confianza el número incorrecto.
Calibración de la confianza#
Otra área donde Claude tuvo un mejor desempeño fue en la calibración de la confianza.
En pocas palabras, cuando Claude reportó alta confianza, era más probable que realmente mereciera esa confianza.
Eso hace que sus puntajes de confianza sean más útiles cuando evalúas la investigación.
¿Qué cambió en Valarn?#
Basado en estos resultados, actualizamos nuestra plataforma.
1. Claude Sonnet se convirtió en nuestro modelo predeterminado.#
La menor tasa de alucinaciones y los puntajes de confianza más confiables lo hicieron la mejor opción para nuestra línea de investigación.
2. GPT sigue siendo parte del proceso.#
No desechamos a GPT.
En cambio, lo usamos donde tiene un buen desempeño.
En algunas Ejecutaciones de Conjunto, GPT proporciona una perspectiva adicional que se verifica contra información verificada antes de convertirse en parte de la investigación final.
Esto nos permite beneficiarnos del análisis detallado de GPT mientras reducimos el riesgo de datos incorrectos.
Algunas notas importantes#
Los modelos de IA mejoran rápidamente.
Tanto Claude como GPT han sido actualizados desde que realizamos este benchmark, por lo que los resultados futuros pueden verse diferentes.
Nuestros prompts también están diseñados específicamente para la investigación financiera. Diferentes prompts o diferentes tareas podrían producir resultados diferentes.
Finalmente, aunque 500 análisis proporcionan un sólido benchmark interno, no son suficientes para hacer afirmaciones amplias sobre cada situación posible.
La conclusión#
No hay un único modelo de IA "mejor".
Cada modelo tiene fortalezas y debilidades.
Hoy, nuestras pruebas muestran que Claude Sonnet proporciona investigación financiera más confiable, menos alucinaciones y puntajes de confianza que estaban mejor calibrados a la confiabilidad de sus propios hallazgos.
Por eso es nuestro modelo de investigación principal hoy.
¿Mañana?
Probaremos de nuevo.
A medida que la IA mejora, Valarn seguirá utilizando los modelos que ofrezcan la investigación más precisa, transparente y confiable para nuestros usuarios—no simplemente los más nuevos o populares.
Valarn
AI Research
Valarn Research Team
