Aller au contenu
BlogAI Research

Claude vs. GPT : Ce que nous avons trouvé

We're model-agnostic. Here's what an internal benchmark of 500 identical financial-research tasks showed when we compared GPT-4o and Claude Sonnet on accuracy, reasoning, hallucinations, and confidence calibration.

V

Valarn

AI Research

28 avril 2026
6 min read
AILLMGPT-4o
Claude vs. GPT : Ce que nous avons trouvé

Chez Valarn, nous sommes agnostiques en matière de modèles.

Cela signifie que nous ne sommes pas liés à un seul modèle d'IA. Nous utilisons le modèle qui offre à nos utilisateurs la meilleure recherche.

Pour nous assurer que nous utilisons les bons outils, nous comparons régulièrement les derniers modèles d'IA.

Plus tôt cette année, nous avons comparé GPT-4o et Claude Sonnet en utilisant 500 tâches de recherche financière identiques.

Une note importante : il s'agit d'un étalon interne, pas d'une étude académique. Ces résultats reflètent nos tests et doivent être considérés comme une aide utile, pas comme une vérité absolue.

Comment nous avons testé#

Nous avons utilisé 500 scénarios de recherche historiques, y compris :

  • 200 grandes entreprises américaines
  • 150 entreprises américaines de taille moyenne
  • 100 ETF sectoriels
  • 50 entreprises internationales

Chaque analyse a été réalisée en utilisant les mêmes invites et les mêmes informations historiques. Comme nous savions déjà ce qui s'était passé par la suite, nous avons pu comparer la recherche de chaque modèle avec la performance ultérieure du marché.

Ce que nous avons mesuré#

Nous avons examiné plusieurs domaines :

  • À quelle fréquence les perspectives du marché global correspondaient à la direction du marché ultérieure.
  • À quel point l'IA expliquait bien son raisonnement.
  • À quelle fréquence elle présentait des informations incorrectes ou inventées.
  • Si ses scores de confiance correspondaient à sa performance réelle.

Résultats globaux#

ModèlePrécision sur 30 joursPrécision sur 90 jours
GPT-4o62.1%58.4%
Claude Sonnet64.8%61.7%

Les deux modèles ont bien performé, mais Claude Sonnet a systématiquement obtenu de meilleurs scores dans nos tests.

La confiance compte#

Une chose a retenu notre attention.

À mesure que Claude Sonnet devenait plus confiant, sa recherche devenait généralement plus fiable.

GPT-4o ne suivait pas le même schéma. En fait, ses analyses à plus forte confiance étaient parfois moins fiables que celles avec une confiance légèrement inférieure.

C'est important car la confiance devrait signifier quelque chose.

Qualité du raisonnement#

Trois analystes seniors ont examiné chaque rapport.

Ils ont recherché :

  • Des explications claires
  • Une utilisation solide des données de soutien
  • Une pensée logique
  • Une discussion honnête de l'incertitude
  • Une prise en compte de différents points de vue

Dans l'ensemble, Claude Sonnet a produit des recherches plus équilibrées et mieux étayées.

GPT-4o fournissait souvent des réponses très détaillées, mais certains détails semblaient plus certains que ce que les preuves disponibles soutenaient.

Parfois, être plus détaillé ne signifie pas être plus précis.

Hallucinations#

C'était la plus grande surprise.

Une hallucination se produit lorsqu'une IA présente des informations incorrectes comme si elles étaient vraies.

Dans nos tests :

  • GPT-4o : 8.3 % des rapports contenaient au moins un point de données incorrect.
  • Claude Sonnet : 3.1 % des rapports contenaient au moins un point de données incorrect.

C'est presque une différence de 3×.

Pour la recherche financière, cela compte.

Un seul chiffre de bénéfice incorrect ou un indicateur financier peut changer toute la conclusion d'une analyse.

Nous préférerions qu'une IA dise "Je ne sais pas" plutôt que de fournir avec confiance le mauvais chiffre.

Calibration de la confiance#

Un autre domaine où Claude a mieux performé était la calibration de la confiance.

En termes simples, lorsque Claude rapportait une forte confiance, il était plus probable qu'il mérite réellement cette confiance.

Cela rend ses scores de confiance plus utiles lorsque vous évaluez la recherche.

Qu'est-ce qui a changé chez Valarn ?#

Sur la base de ces résultats, nous avons mis à jour notre plateforme.

1. Claude Sonnet est devenu notre modèle par défaut.#

Le taux d'hallucination plus bas et des scores de confiance plus fiables en ont fait le meilleur choix pour notre pipeline de recherche.

2. GPT fait toujours partie du processus.#

Nous n'avons pas écarté GPT.

Au lieu de cela, nous l'utilisons là où il performe bien.

Dans certaines Exécutions d'Ensemble, GPT fournit une perspective supplémentaire qui est vérifiée par rapport à des informations vérifiées avant de devenir partie intégrante de la recherche finale.

Cela nous permet de bénéficier de l'analyse détaillée de GPT tout en réduisant le risque de données incorrectes.

Quelques notes importantes#

Les modèles d'IA s'améliorent rapidement.

Claude et GPT ont tous deux été mis à jour depuis que nous avons réalisé cet étalon, donc les résultats futurs peuvent sembler différents.

Nos invites sont également conçues spécifiquement pour la recherche financière. Différentes invites ou différentes tâches pourraient produire des résultats différents.

Enfin, bien que 500 analyses fournissent un solide étalon interne, elles ne suffisent pas à faire des affirmations générales sur chaque situation possible.

En résumé#

Il n'existe pas de modèle d'IA "meilleur" unique.

Chaque modèle a des forces et des faiblesses.

Aujourd'hui, nos tests montrent que Claude Sonnet fournit une recherche financière plus fiable, moins d'hallucinations, et des scores de confiance qui étaient mieux calibrés par rapport à la fiabilité de leurs propres conclusions.

C'est pourquoi c'est notre modèle de recherche principal aujourd'hui.

Demain ?

Nous testerons à nouveau.

À mesure que l'IA s'améliore, Valarn continuera d'utiliser les modèles qui fournissent la recherche la plus précise, transparente et digne de confiance pour nos utilisateurs—pas simplement les plus récents ou les plus populaires.

TagsAILLMGPT-4oClaudeBenchmarking
V

Valarn

AI Research

Valarn Research Team

Valarn

Try Valarn for free

Run AI-powered analysis on any stock in under 5 minutes.

Get started free