在 Valarn,我们是 模型无关 的。
这意味着我们不依赖于单一的 AI 模型。我们使用任何能够为用户提供最佳研究的模型。
为了确保我们使用正确的工具,我们定期比较最新的 AI 模型。
今年早些时候,我们使用 500 个相同的金融研究任务 比较了 GPT-4o 和 Claude Sonnet。
一个重要的说明:这是一个 内部基准,而不是学术研究。这些结果反映了我们的测试,应该被视为有用的指导,而不是绝对的真理。
我们是如何测试的#
我们使用了 500 个历史研究场景,包括:
- 200 家大型美国公司
- 150 家中型美国公司
- 100 个行业 ETF
- 50 家国际公司
每个分析都是使用相同的提示和相同的历史信息进行的。因为我们已经知道之后发生了什么,所以我们可以将每个模型的研究与市场后来的表现进行比较。
我们测量了什么#
我们关注了几个方面:
- 整体市场前景与后来的市场方向匹配的频率。
- AI 解释其推理的能力。
- 它呈现不正确或虚构信息的频率。
- 其置信度分数是否与实际表现相匹配。
总体结果#
| 模型 | 30 天准确率 | 90 天准确率 |
|---|---|---|
| GPT-4o | 62.1% | 58.4% |
| Claude Sonnet | 64.8% | 61.7% |
两个模型的表现都很好,但 Claude Sonnet 在我们的测试中始终得分更高。
置信度的重要性#
有一点非常突出。
随着 Claude Sonnet 变得更加自信,它的研究通常变得更加可靠。
GPT-4o 并没有遵循相同的模式。事实上,它的最高置信度分析有时 不如 置信度稍低的分析可靠。
这很重要,因为置信度应该意味着某种东西。
推理的质量#
三位高级分析师审查了每一份报告。
他们寻找:
- 清晰的解释
- 强有力的支持数据使用
- 逻辑思维
- 对不确定性的诚实讨论
- 考虑不同的观点
总体而言,Claude Sonnet 产生了更平衡和更有支持的研究。
GPT-4o 经常提供非常详细的答案,但有些细节听起来比可用证据所支持的更为确定。
有时,更详细并不意味着更准确。
幻觉#
这是最大的惊喜。
当 AI 呈现不正确的信息 时,就会发生幻觉,仿佛它是真实的。
在我们的测试中:
- GPT-4o: 8.3% 的报告包含至少一个不正确的数据点。
- Claude Sonnet: 3.1% 的报告包含至少一个不正确的数据点。
这几乎是 3 倍的差异。
对于金融研究来说,这很重要。
一个 单一的不正确收益数字 或财务指标可以改变整个分析的结论。
我们宁愿让 AI 说 “我不知道”,也不愿自信地提供错误的数字。
置信度校准#
Claude 表现更好的另一个领域是 置信度校准。
简单来说,当 Claude 报告高置信度时,它更有可能真正值得这种置信度。
这使得在评估研究时,它的置信度分数更有用。
Valarn 有什么变化?#
基于这些结果,我们更新了我们的平台。
1. Claude Sonnet 成为我们的默认模型。#
较低的幻觉率和更可靠的置信度分数使其成为我们研究流程的更好选择。
2. GPT 仍然是流程的一部分。#
我们没有将 GPT 淘汰。
相反,我们在它表现良好的地方使用它。
在某些 集成运行 中,GPT 提供了额外的视角,在成为最终研究的一部分之前与经过验证的信息进行核对。
这让我们能够受益于 GPT 的详细分析,同时降低了不正确数据的风险。
一些重要说明#
AI 模型快速改进。
自我们进行此基准测试以来,Claude 和 GPT 都已更新,因此未来的结果可能会有所不同。
我们的提示也是专门为金融研究设计的。不同的提示或不同的任务可能会产生不同的结果。
最后,虽然 500 个分析提供了一个可靠的内部基准,但它们不足以对每种可能的情况做出广泛的声明。
结论#
没有单一的“最佳” AI 模型。
每个模型都有其优缺点。
今天,我们的测试显示 Claude Sonnet 提供了 更可靠的金融研究、更少的幻觉,以及与其自身发现的可靠性更好校准的置信度分数。
这就是为什么它今天是我们的主要研究模型。
明天?
我们会再次测试。
随着 AI 的进步,Valarn 将继续使用那些为我们的用户提供最准确、透明和可信研究的模型——而不仅仅是最新或最受欢迎的模型。
Valarn
AI Research
Valarn Research Team
