通用 Benchmark 能刷分,却常常答不准金融机构真正卡的点:资金流向怎么识别、复杂文档怎么还原、长文本 Agent 怎么压上下文还不丢关键事实,以及每一次调用要花多少 Token。八月末在上海举行的 AFAC 金融智能创新大赛(AFAC2026)总决赛近窗公开材料显示,本届正式开源「AFAC百万金融智能数据集」。
该数据集联合发起阵容包括上海市科委、中国计算机学会、北京大学、蚂蚁集团、GFTN、真格基金、中国银行等 30 余家机构。赛事累计四届已吸引超约 2 万支队伍、约 6 万名选手。公开材料强调:规模与条目数为赛事公开口径;数据集获取与使用条款以官方发布页为准。
数据集与赛题要点:
所谓百万金融智能数据集,白话是把历年真题与优胜方案沉淀成可复用评测与文档资产,让后来者不必从零猜「金融到底难在哪」;所谓 Token 经济学进赛题,白话是把账单写进能力定义——答案要可复核,调用也要算账。
放在金融科技与大模型上下文里,机构采购越来越不接受「只看通用榜」。可解释、可复现、可控制上下文成本,才接近业务验收。对参赛团队与后来的二次开发者,优胜方案与文档样本降低了「不知道金融任务长什么样」的冷启动成本;对模型厂,则可据此对照通用能力与行业适配差距。开源飞轮能否转起来,取决于脱敏合规、持续更新与产业复用接口。
产业影响上,这为金融科技与大模型厂商提供了一条比通用 Benchmark 更接近业务的对照轴。需要把边界读清楚:规模与条目数为赛事公开口径;使用条款以官方发布页为准。下一观察点是开源仓活跃度与机构二次开发案例。