Pular para o conteúdo
BlogAI Research

Claude vs. GPT: O Que Encontrámos

We're model-agnostic. Here's what an internal benchmark of 500 identical financial-research tasks showed when we compared GPT-4o and Claude Sonnet on accuracy, reasoning, hallucinations, and confidence calibration.

V

Valarn

AI Research

28 de abril de 2026
6 min read
AILLMGPT-4o
Claude vs. GPT: O Que Encontrámos

Na Valarn, somos agnósticos em relação a modelos.

Isso significa que não estamos ligados a um único modelo de IA. Usamos qualquer modelo que ofereça aos nossos utilizadores a melhor pesquisa.

Para garantir que estamos a usar as ferramentas certas, comparamos regularmente os mais recentes modelos de IA.

No início deste ano, comparamos GPT-4o e Claude Sonnet usando 500 tarefas de pesquisa financeira idênticas.

Uma nota importante: este é um benchmark interno, não um estudo académico. Estes resultados refletem os nossos testes e devem ser vistos como uma orientação útil, não como uma verdade absoluta.

Como Testámos#

Usámos 500 cenários de pesquisa históricos, incluindo:

  • 200 grandes empresas dos EUA
  • 150 empresas de médio porte dos EUA
  • 100 ETFs de setores
  • 50 empresas internacionais

Cada análise foi realizada usando os mesmos prompts e as mesmas informações históricas. Como já sabíamos o que aconteceu depois, pudemos comparar a pesquisa de cada modelo com o desempenho posterior do mercado.

O Que Medimos#

Analisámos várias áreas:

  • Com que frequência a perspetiva geral do mercado correspondeu à direção do mercado posterior.
  • Quão bem a IA explicou o seu raciocínio.
  • Com que frequência apresentou informações incorretas ou inventadas.
  • Se as suas pontuações de confiança corresponderam ao seu desempenho real.

Resultados Gerais#

ModeloPrecisão a 30 DiasPrecisão a 90 Dias
GPT-4o62.1%58.4%
Claude Sonnet64.8%61.7%

Ambos os modelos tiveram um bom desempenho, mas o Claude Sonnet obteve consistentemente pontuações mais altas nos nossos testes.

A Confiança Importa#

Uma coisa destacou-se.

À medida que o Claude Sonnet se tornava mais confiante, a sua pesquisa tornava-se geralmente mais fiável.

O GPT-4o não seguiu o mesmo padrão. Na verdade, as suas análises de maior confiança eram às vezes menos fiáveis do que aquelas com confiança ligeiramente inferior.

Isso é importante porque a confiança deve significar algo.

Qualidade do Raciocínio#

Três analistas seniores revisaram cada relatório.

Procuraram por:

  • Explicações claras
  • Uso forte de dados de apoio
  • Pensamento lógico
  • Discussão honesta sobre incertezas
  • Consideração de diferentes pontos de vista

No geral, o Claude Sonnet produziu pesquisas mais equilibradas e melhor apoiadas.

O GPT-4o frequentemente fornecia respostas muito detalhadas, mas alguns detalhes soavam mais certos do que as evidências disponíveis apoiavam.

Às vezes, ser mais detalhado não significa ser mais preciso.

Alucinações#

Esta foi a maior surpresa.

Uma alucinação acontece quando uma IA apresenta informações incorretas como se fossem verdadeiras.

Nos nossos testes:

  • GPT-4o: 8.3% dos relatórios continham pelo menos um ponto de dados incorreto.
  • Claude Sonnet: 3.1% dos relatórios continham pelo menos um ponto de dados incorreto.

Isso representa uma diferença de quase 3×.

Para pesquisa financeira, isso é importante.

Um único número de lucros incorreto ou métrica financeira pode mudar toda a conclusão de uma análise.

Preferimos que uma IA diga "não sei" do que fornecer confiantemente o número errado.

Calibração da Confiança#

Outra área onde o Claude teve um desempenho melhor foi na calibração da confiança.

Simplificando, quando o Claude reportou alta confiança, era mais provável que realmente merecesse essa confiança.

Isso torna as suas pontuações de confiança mais úteis quando está a avaliar pesquisas.

O Que Mudou na Valarn?#

Com base nestes resultados, atualizámos a nossa plataforma.

1. Claude Sonnet tornou-se o nosso modelo padrão.#

A menor taxa de alucinações e as pontuações de confiança mais fiáveis tornaram-no a melhor escolha para o nosso pipeline de pesquisa.

2. O GPT ainda faz parte do processo.#

Não descartámos o GPT.

Em vez disso, usamos-o onde ele se destaca.

Em algumas Execuções de Conjunto, o GPT fornece uma perspetiva adicional que é verificada contra informações verificadas antes de se tornar parte da pesquisa final.

Isso permite-nos beneficiar da análise detalhada do GPT enquanto reduzimos o risco de dados incorretos.

Algumas Notas Importantes#

Os modelos de IA melhoram rapidamente.

Tanto o Claude como o GPT foram atualizados desde que realizámos este benchmark, por isso os resultados futuros podem ser diferentes.

Os nossos prompts também são projetados especificamente para pesquisa financeira. Prompts diferentes ou tarefas diferentes podem produzir resultados diferentes.

Finalmente, embora 500 análises forneçam um benchmark interno sólido, não são suficientes para fazer afirmações amplas sobre todas as situações possíveis.

A Conclusão#

Não existe um único modelo de IA "melhor".

Cada modelo tem pontos fortes e fracos.

Hoje, os nossos testes mostram que o Claude Sonnet fornece pesquisa financeira mais fiável, menos alucinações e pontuações de confiança que foram melhor calibradas para a fiabilidade das suas próprias descobertas.

É por isso que é o nosso modelo de pesquisa principal hoje.

E amanhã?

Vamos testar novamente.

À medida que a IA melhora, a Valarn continuará a usar os modelos que oferecem a pesquisa mais precisa, transparente e confiável para os nossos utilizadores—não simplesmente os mais novos ou os mais populares.

TagsAILLMGPT-4oClaudeBenchmarking
V

Valarn

AI Research

Valarn Research Team

Valarn

Try Valarn for free

Run AI-powered analysis on any stock in under 5 minutes.

Get started free