Bei Valarn sind wir modellunabhängig.
Das bedeutet, dass wir nicht an ein bestimmtes KI-Modell gebunden sind. Wir verwenden das Modell, das unseren Nutzern die beste Forschung bietet.
Um sicherzustellen, dass wir die richtigen Werkzeuge verwenden, vergleichen wir regelmäßig die neuesten KI-Modelle.
Anfang dieses Jahres haben wir GPT-4o und Claude Sonnet anhand von 500 identischen finanziellen Forschungsaufgaben verglichen.
Ein wichtiger Hinweis: Dies ist ein internes Benchmark, keine akademische Studie. Diese Ergebnisse spiegeln unsere Tests wider und sollten als hilfreiche Orientierung, nicht als absolute Wahrheit, betrachtet werden.
Wie wir getestet haben#
Wir verwendeten 500 historische Forschungsszenarien, darunter:
- 200 große US-Unternehmen
- 150 mittelgroße US-Unternehmen
- 100 Sektor-ETFs
- 50 internationale Unternehmen
Jede Analyse wurde mit denselben Eingabeaufforderungen und denselben historischen Informationen durchgeführt. Da wir bereits wussten, was danach geschah, konnten wir die Forschung jedes Modells mit der späteren Marktperformance vergleichen.
Was wir gemessen haben#
Wir haben mehrere Bereiche betrachtet:
- Wie oft die allgemeine Markteinschätzung mit der späteren Marktrichtung übereinstimmte.
- Wie gut die KI ihr Vorgehen erklärte.
- Wie oft sie falsche oder erfundene Informationen präsentierte.
- Ob ihre Vertrauenswerte mit ihrer tatsächlichen Leistung übereinstimmten.
Gesamtergebnisse#
| Modell | 30-Tage Genauigkeit | 90-Tage Genauigkeit |
|---|---|---|
| GPT-4o | 62.1% | 58.4% |
| Claude Sonnet | 64.8% | 61.7% |
Beide Modelle schnitten gut ab, aber Claude Sonnet erzielte in unseren Tests durchweg höhere Werte.
Vertrauen zählt#
Eine Sache fiel auf.
Als Claude Sonnet selbstbewusster wurde, wurde seine Forschung im Allgemeinen zuverlässiger.
GPT-4o folgte nicht demselben Muster. Tatsächlich waren seine Analysen mit dem höchsten Vertrauen manchmal weniger zuverlässig als solche mit etwas geringerem Vertrauen.
Das ist wichtig, denn Vertrauen sollte etwas bedeuten.
Qualität des Denkens#
Drei leitende Analysten überprüften jeden Bericht.
Sie suchten nach:
- Klaren Erklärungen
- Starker Nutzung unterstützender Daten
- Logischem Denken
- Ehrlicher Diskussion von Unsicherheiten
- Berücksichtigung unterschiedlicher Standpunkte
Insgesamt lieferte Claude Sonnet ausgewogenere und besser unterstützte Forschung.
GPT-4o gab oft sehr detaillierte Antworten, aber einige Details klangen sicherer, als die verfügbaren Beweise unterstützten.
Manchmal bedeutet mehr Detail nicht mehr Genauigkeit.
Halluzinationen#
Das war die größte Überraschung.
Eine Halluzination tritt auf, wenn eine KI falsche Informationen präsentiert, als wären sie wahr.
In unseren Tests:
- GPT-4o: 8.3% der Berichte enthielten mindestens einen falschen Datenpunkt.
- Claude Sonnet: 3.1% der Berichte enthielten mindestens einen falschen Datenpunkt.
Das ist fast ein 3× Unterschied.
Für finanzielle Forschung ist das wichtig.
Eine einzelne falsche Gewinnzahl oder finanzielle Kennzahl kann die gesamte Schlussfolgerung einer Analyse ändern.
Wir würden lieber eine KI sagen hören "Ich weiß es nicht", als selbstbewusst die falsche Zahl anzugeben.
Vertrauenskalibrierung#
Ein weiterer Bereich, in dem Claude besser abschnitt, war die Vertrauenskalibrierung.
Einfach ausgedrückt, wenn Claude ein hohes Vertrauen meldete, war es wahrscheinlicher, dass es dieses Vertrauen tatsächlich verdiente.
Das macht seine Vertrauenswerte nützlicher, wenn Sie Forschung bewerten.
Was hat sich bei Valarn geändert?#
Basierend auf diesen Ergebnissen haben wir unsere Plattform aktualisiert.
1. Claude Sonnet wurde unser Standardmodell.#
Die niedrigere Halluzinationsrate und die zuverlässigeren Vertrauenswerte machten es zur besseren Wahl für unsere Forschungs-Pipeline.
2. GPT ist weiterhin Teil des Prozesses.#
Wir haben GPT nicht ausgeschlossen.
Stattdessen nutzen wir es dort, wo es gut abschneidet.
In einigen Ensemble-Läufen bietet GPT eine zusätzliche Perspektive, die vor der Einbeziehung in die endgültige Forschung mit verifizierten Informationen überprüft wird.
So können wir von GPTs detaillierter Analyse profitieren, während wir das Risiko falscher Daten reduzieren.
Einige wichtige Hinweise#
KI-Modelle verbessern sich schnell.
Sowohl Claude als auch GPT wurden seit unserem Benchmark aktualisiert, sodass zukünftige Ergebnisse anders aussehen könnten.
Unsere Eingabeaufforderungen sind auch speziell für die finanzielle Forschung konzipiert. Unterschiedliche Eingabeaufforderungen oder unterschiedliche Aufgaben könnten unterschiedliche Ergebnisse liefern.
Schließlich sind 500 Analysen zwar ein solides internes Benchmark, aber nicht ausreichend, um allgemeine Aussagen über jede mögliche Situation zu treffen.
Fazit#
Es gibt nicht das eine "beste" KI-Modell.
Jedes Modell hat Stärken und Schwächen.
Heute zeigt unser Test, dass Claude Sonnet zuverlässigere finanzielle Forschung, weniger Halluzinationen und Vertrauenswerte bietet, die besser auf die Zuverlässigkeit ihrer eigenen Ergebnisse kalibriert sind.
Deshalb ist es heute unser primäres Forschungsmodell.
Morgen?
Wir werden erneut testen.
Während sich die KI verbessert, wird Valarn weiterhin die Modelle verwenden, die die genaueste, transparenteste und vertrauenswürdigste Forschung für unsere Nutzer liefern – nicht einfach die neuesten oder beliebtesten.
Valarn
AI Research
Valarn Research Team
