桥水基金|前沿AI金融判断准确率未达可信门槛

PromptTree|阅读 1
2026/07/26 15:31
桥水基金金融AIGPTClaudeGemini
本周桥水基金联合Thinking Machines Lab测试GPT、Claude、Gemini等前沿模型的金融判断,准确率约50%至70%,未达到其设定的80%可信门槛。基于开源模型微调的自研方案,在准确率与成本上更具优势。

能写一份像样的市场评论,不等于能做可追责的金融判断。桥水把这句话测成了区间。

桥水基金是以宏观对冲知名的资管机构。本周,它联合Thinking Machines Lab,测试GPT、Claude、Gemini等前沿大模型的金融判断能力。结果是准确率大约在50%到70%之间,没有达到桥水自己设定的80%可信门槛。对比之下,基于开源模型做领域微调的自研方案,在准确率和成本上更具优势。测试题目和各模型的单项分数,消息里没有拆开。

大模型擅长理解和生成自然语言。金融决策要的是高精度、可复现、出了错能追责。50%到70%的意思是:把它当灵感来源可以,把它当自动下单的引擎还早。80%是桥水的内部门槛,不是全行业统一标准。别的机构可以设得更高或更低,但不能把「模型会说话」直接写成「模型可交易」。

开源加上领域微调更占优,原因也具体。任务边界清楚,数据可以由机构自己控制,成本可以算进预算。闭源旗舰的通用能力强,却不一定在某一类金融判断上超过专门喂过数据的小模型。采购最贵的接口,不会自动等于风控合格。

对机构,警示是把场景拆细。研报摘要、数据提取、合规核对,和「这笔交易该不该做」,不是同一个准确率。前者可以先用,后者仍要人签字。下一观察点是桥水会不会公布80%门槛对应的题库。没有题库,50%到70%只是一个区间,无法判断模型是在哪一类判断上失败。

50%到70%的跨度很大。靠近下限时,和抛硬币的差别有限;靠近上限时,已经可以当研究助理,仍低于80%的内部门槛。门槛是桥水和Thinking Machines Lab这次自定的,换一套题,区间可能移动。消息没有拆开各模型的单项分数。

GPT、Claude、Gemini被放在一起,比的是前沿闭源模型这一类。开源微调在准确率和成本上更优,对机构的含义具体:行情、持仓和合规文本可以喂进自己可控的模型,判断不必外包给最贵接口。研报摘要可以先用模型,交易决策仍要人签字。没有公开题库,这个区间就无法被外部复核。