能写研报,不等于能做可信的金融判断——桥水把这句话测成了数据。
本周,桥水基金联合Thinking Machines Lab,对GPT、Claude、Gemini等前沿大模型进行金融判断测试。结果显示准确率约在50%至70%,未达到其设定的80%可信门槛。对比之下,基于开源模型微调的自研方案,在准确率与成本上反而更具优势。
大模型擅长自然语言理解与生成,但金融决策要求的是高精度、可复现、可追责的判断。50%–70%的准确率意味着:把它当“灵感助手”可以,把它当“决策引擎”还早。开源加领域微调之所以更务实,是因为任务边界清晰、数据可控、成本可算。
对金融机构而言,警示很直接——采购最贵的闭源旗舰,并不自动等于风控合格。场景拆细、数据喂透、开源微调,可能比“一把梭顶级API”更靠谱。