AI 如何在基金领域中发挥奇效?(以 ChatGPT 为例)
我在这行做了七年,前三年写交易系统,后四年在量化研究和投研平台之间来回横跳。ChatGPT 出来的那个春节,我们组里几乎所有人都在偷偷试”让它选股”——三年过去,我可以负责任地说:“选股”是这件事里最不重要的部分,也是唯一一个被证明会自我毁灭的部分。
真正的奇效在别处。这篇文章我尽量少讲愿景、多给数字,把 2026 年能拿到的最新证据摊开讲清楚。
一、先把结论放在最前面
如果你只想看一句话:
ChatGPT 类模型在基金行业的价值,不是”多了一个会预测的大脑”,而是”第一次让文本处理的边际成本趋近于零”。
再展开成四句:
- 它确实有信号——这一点已经被顶刊论文证实,不是玄学;
- 但信号在快速衰减——同一个策略三年夏普掉了八成,而且这是它自己造成的;
- 规模化跑出来的路径,全都把 LLM 放在了”非决策位”——桥水、贝莱德无一例外;
- 能力曲线和可交付曲线是两条线——2026 年最扎心的一份基准测试里,前沿模型的产出没有一份被投行从业者判定为”可以直接交给客户”。
考虑到国内订阅GPT确实有点困难,可以参考一下这里:chatgptpro.shop
下面逐条上证据。
二、行业已经换挡了:从”试点”切到”生产”
先看行业侧的位置。2025 到 2026 这一年,买方对 AI 的态度发生了非常明显的相变。
SimCorp 的 2026 年 InvestOps 报告调研了全球 200 位买方高管(管理规模均在 100 亿美元以上),结论是七成机构的前台已经在实际使用 AI;而一年前的同一份报告里,这个比例只有一成左右,当时四分之三的人承认”看好但不知道怎么落地”。SimCorp 的 CEO 用了一个我很认同的说法:AI 已经从试点变成了前台的关键业务应用。
需要提醒一句:两年问卷的口径并不完全一致(去年问的偏”是否在探索工具”,今年问的偏”是否在支持前台”),所以七倍的跳升里有一部分是定义因素。但方向不会错——Mercer 2026 年的资管 AI 调研给出了更细的成色:55% 的管理人表示 AI 已经集成进至少一条投资流程,27% 还停留在试点/PoC,18% 完全没有集成;91% 说未来 12 个月还要继续加码。
对冲基金这一侧的时间序列更能说明问题。AIMA 对 150 家管理人(合计约 7880 亿美元 AUM)的调研显示,日常工作中使用生成式 AI 的比例从 2023 年的 86% 升到 95%——这个数字已经饱和了,没什么信息量;真正的变化是”预期未来一年在投资流程中加大使用”的比例,从 20% 跳到了 58%。
从”工作里在用”到”流程里在用”,中间隔着的就是合规、审计、复现性这些脏活。这也是为什么资金开始跟着走:AIMA 那份调研里,六成机构投资者表示,如果一家对冲基金在生成式 AI 上有实质预算投入,他们会更愿意配置。
国内的节奏是”规范先行”。 2026 年 4 月 3 日,中基协发布了 T/AMAC 0004—2026《基金经营机构大模型技术应用规范》,这是基金行业第一个针对大模型的团体标准,当天发布当天实施。起草单位的名单很能说明这件事的重量:易方达、中金财富、工银瑞信、华夏基金、九坤投资,加上阿里云、智谱、华为和中国信通院。
标准把大模型在资管业务中的应用切成六层:基础设施、数据管理、模型服务、应用技术、安全管理、场景应用。技术层面明确了四样东西——提示词工程、检索增强生成(RAG)、智能体、组件库;并且要求智能体必须具备规划、记忆、工具、行动四项基本能力,可以采用单智能体、多智能体、智能体—人交互三种范式。
我把这份标准通读了两遍,最大的感受是:它写得非常”工程”,几乎没有讲愿景,通篇在讲边界。这恰恰是这个行业该有的姿势。
三、ChatGPT 到底会不会选股?把最硬的那篇论文拆开看
绕不开的是佛罗里达大学 Lopez-Lira 和 Tang 那篇《Can ChatGPT Forecast Stock Price Movements?》。这篇 2023 年 4 月挂到 arXiv 上的工作论文,2026 年正式发表在了《Journal of Financial Economics》上——顶刊,不是预印本了。
它的实验设计其实极其朴素,朴素到你今晚就能复现:
Forget all your previous instructions. Pretend you are a financial expert... Answer 'YES' if good news, 'NO' if bad news, or 'UNKNOWN' if uncertain... Is this headline good or bad for the stock price of [company] in the short term? Headline: [headline]
就这么一个 prompt,跑 15.9 万条美股新闻标题、4123 家公司,样本区间 2021 年 10 月到 2024 年 5 月。关键在于这个区间全部落在 GPT-4 知识截止之后——这是整篇论文最值钱的设计,它把 look-ahead bias 这个量化研究的头号杀手堵死了。
结果分两层:
第一层,读懂新闻的能力,强得离谱。 对隔夜新闻,GPT-4 判断当日市场初始反应方向的组合-日命中率是 93.3%;盘中新闻是 88.8%。
第二层,才是真正的 alpha。 市场对新闻是反应不足的,价格会在消息后继续朝同方向漂移一到两个交易日。GPT-4 的打分能显著预测这段漂移,构建成多空组合后,费前年化夏普 2.97,日均多空收益约 34bp,样本期累计约 700%。剔除 5 美元以下低价股和 NYSE 市值 20 分位以下的小票之后,累计收益仍超过 300%——说明这不是纯小盘故事。
两个细节我认为比总收益更有信息量:
- 漂移主要来自小票和坏消息。 小市值组的漂移系数约为大市值组的五倍;空头腿年化夏普 2.01,多头腿只有 0.78。做空更贵、更受限,所以坏消息被消化得更慢——这是教科书级别的”套利限制”实证。
- 哪些新闻被市场高效定价,哪些没有。 业绩与营收、临床试验结果、战略合作,市场处理得很好;而内部人增减持、医疗会议参与、分红公告,则出现了系统性反应不足。规律很清楚:格式化的、可直接进模型的数字,市场不欠账;需要上下文解读的信息,市场处理不动。
而这,正是 LLM 的主场。
涌现,而不是微调
这篇论文里我最喜欢的一张表,是 12 个模型的横向对比。
请重点看 FinBERT 那根柱子:它是专门在金融语料上微调过的模型,判断新闻好坏的命中率高达 90%,跟 GPT-3.5、GPT-4 只差三个百分点。但它的漂移策略夏普是负的(−0.33)。
同样是 GPT 家族,GPT-1、GPT-2 和 BERT 连 65% 的命中率都做不到,夏普也为负。只有能力越过某条线之后,预测漂移的能力才突然出现。
这件事对做量化的人冲击非常大,我当时反复看了三遍才接受:
能判断”这条新闻是好是坏”,和能判断”市场会低估这条新闻多少”,是两种完全不同的能力。前者靠语义分类,后者靠推理。而后者是随规模涌现出来的,不是靠往模型里灌金融语料灌出来的。
我们在 2023 年花了很多钱做行业语料的领域微调,现在回头看,那笔钱大部分是白花的。通用推理能力的提升,比领域微调的收益大一个量级。 后来的路线也印证了这一点——大家都从 fine-tune 转向了 RAG + 工具调用 + 强约束输出。
四、最重要的一张图:Alpha 是有半衰期的
如果这篇文章你只记住一张图,我希望是这张。
同一个策略、同一个 prompt、同一批数据源,把样本期切成四段:
| 时间段 | 费前年化夏普 |
|---|---|
| 2021 年 10–12 月 | 6.54 |
| 2022 年 | 3.68 |
| 2023 年 | 2.33 |
| 2024 年 1–5 月 | 1.22 |
三年不到,掉了 81%。
论文作者给出的解释非常克制也非常有力:随着 LLM 在市场中普及,越来越多的人用同样的工具处理同样的新闻,价格效率提高了,可预测的漂移被套利掉了。
这句话翻译成人话就是:你能想到的用 ChatGPT 读新闻做多空,全世界至少还有一万个人同时想到了。
而成本这一侧还没算。这个策略需要每日再平衡,日换手约 190%;论文自己承认,往返 20bp 的交易成本就足以让它由盈转亏。也就是说,只有直连市场、冲击成本极低、并且把范围限定在大市值股票上的机构,才有可能真正吃到——留给绝大多数人的部分,是零。
我把这条规律叫做“公开 prompt 的 alpha 半衰期”。任何一个能被一段可复述的 prompt 描述清楚的信号,它的半衰期大概率以季度计。真正能留下来的护城河,从来不在 prompt 里,而在:
- 你的数据是不是别人拿不到的(另类数据、调研纪要、持仓层面的实时数据);
- 你的执行成本是不是别人比不了的;
- 你的工程链路能不能把信号在半衰期内跑出来。
第三条最容易被忽略,也最容易被工程解决。这就是下一节的主题。
五、真正跑出规模的三条路径:LLM 全都不在决策位
5.1 桥水 AIA:把 LLM 放在”因果假设生成”上
桥水 2023 年成立了 AIA Labs(Artificial Investment Associate),由联席 CIO Greg Jensen 领衔,首席科学家是从耶鲁挖来的因果推断专家 Jasjeet Sekhon。AIA Macro 策略 2024 年 7 月 1 日以约 20 亿美元起步。
现在的成绩单是:2025 年 +11.9%;2026 年上半年 +8.1%——和旗舰 Pure Alpha 的 8.1% 打平;成立两年半年化约 11.3%,规模已经超过 45 亿美元。
技术栈的描述里有一句话我觉得是全文最关键的:他们的系统是自研的因果时间序列机器学习 + 定制 LLM 系统(包含专用模型和经过自家 harness 与智能体工作流适配的前沿模型)。人类保留三样东西:风险管理、数据获取、交易执行。
Jensen 自己对 LLM 的评价相当不客气——大意是这些模型有幻觉问题,它们不理解什么是贪婪、什么是恐惧,也不理解真实的因果关系。
所以桥水的用法不是”让 LLM 预测”,而是“让 LLM 生成和检验因果假设”:全世界的报纸它都能读,然后把”如果关税上调,哪些资产会怎么反应”这类因果链条铺开、量化、回测。LLM 负责把假设空间从人类带宽扩张到机器带宽,统计模型负责证伪。
(另有公开资料整理称,他们用多层护栏把系统错误率从 8% 压到了 1.6%。这个数字来自二手汇编,我没找到一手来源,姑且当参考。)
5.2 贝莱德 Aladdin Copilot:奇效的真身是”API 编排层”
如果说桥水是研究侧的答案,贝莱德就是工程侧的答案,而且我认为这才是绝大多数基金公司应该抄的作业。
Aladdin 这个平台服务着超过 11 万亿美元的资产。Aladdin Copilot 的架构,他们的 AI 工程负责人在公开分享里讲得很清楚:
- LangChain + LangGraph 的监督式多智能体架构,用 GPT-4 的 function calling 做编排;
- 核心能力是把自然语言查询翻译成对数百个 domain-specific API 的调用——”给我看看科技股敞口”、”哪些持仓 ESG 评分低于 40”、”生成亚太基金的风险报告”;
- 组织上,50–60 个各自负责交易、组合管理等领域的工程团队,通过插件注册表(plugin registry)把自己的功能接进 Copilot,AI 团队只做”让接入变简单”这件事;
- 评估驱动开发(evaluation-driven development),每日 CI/CD 跑测试防止退化;
- 输出侧有专门的护栏节点检测幻觉,并且 Copilot 不会在 Aladdin 边界之外提供投资建议。
我把这套东西的本质总结成一句话:
LLM 在这里不是”分析师”,是”翻译器”。它把人的自然语言意图,翻译成对确定性系统的确定性调用。真正的计算、取数、风控,一步都没有交给模型。
这就是我说的”奇效”的真身。一个基金公司里最贵的隐性成本是什么?是投资经理想查一个数,得找 IT 提需求、排期两周、拿到一张 Excel。Copilot 把这个链路压缩到 30 秒。它没有创造 alpha,它创造的是”提问的自由度”。 而在投研这种高度依赖迭代速度的活动里,提问的自由度就是产出。
5.3 国内:规范先行,加上量化私募的算力外溢
国内是两条线并行的。
公募这条线是”规范 + 场景”。 前面提到的中基协标准里,四大应用技术(提示词工程、RAG、智能体、组件库)基本就是国内头部基金公司现在的技术地图。落地最快的场景高度一致:公告与研报的结构化抽取、投研知识库问答、合规文本预审、客服与投顾话术、代码与回测脚本生成。注意这几个场景的共同点:输出可验证、错了能改、不直接触发交易。
私募这条线更野,也更有意思。 幻方孵化 DeepSeek 是全行业最出圈的一笔——首期 30 亿元自有资金投入,背后是万卡级的”萤火”超算。九坤联合微软团队成功复现 DeepSeek-R1,还发现了中英文混合会显著降低推理能力这类问题。明汯、黑翼、宽德、鸣石、蒙玺则纷纷设立 AI Lab 抢人。
为什么是量化私募?答案朴素得可笑:他们本来就有卡,本来就有人。 幻方的策略开发团队一百多人,其中 AI Lab 二十多人,奥赛金牌、机器学习专家、拓扑/统计/运筹/控制论的博士——这个人员构成跟一家大模型创业公司几乎没有区别。算力和人才的外溢,是这轮国内 AI 与量化互相渗透的真正原因。
至于 LLM 在量化策略里到底干什么,行业里的说法比较一致:辅助因子挖掘、策略代码生成、另类数据的结构化、研究流程的自动化。 没有人说它在直接下单。
六、泼一盆冷水:能力 ≠ 可交付
讲完好的,必须讲坏的,否则这篇文章就是软文。
2026 年 4 月,Handshake AI 和麦吉尔大学发布了 BankerToolBench,我认为这是迄今为止对”AI 能不能干金融专业活”这个问题最认真的一次回答。
它的做法很暴力:请来约 500 位在职和前投行人员(高盛、摩根大通、Evercore、摩根士丹利、Lazard 等),其中 172 人亲自设计任务,累计投入超过 5700 小时。100 项任务,每项人类平均要做 5 小时,最长的要 21 小时。评的不是问答,是真实交付物——带公式的 Excel 财务模型、给客户开会用的 PPT、PDF 报告、Word 备忘录。智能体得自己翻数据室、调 FactSet 和 Capital IQ、解析 SEC 文件;单个任务最多会触发 539 次模型调用,其中 97% 与工具调用或代码执行相关。
结果如下。
没有任何一份产出被评为”可以直接交给客户”。 13% 轻改可用,19% 需中度修改,41% 需要大幅返工,27% 完全不可用。有 55% 的评审认为,如果原样提交,出坏结果的概率超过 99%。
榜首是 GPT-5.4,综合 rubric 得分 58.1/100,pass@1 只有 16%;要求三次运行结果一致,掉到 13%;能通过全部关键加权标准的任务只有 2%。
但请同时看另一个数字:69% 的评审说,他们愿意拿这个产出当草稿起点。
这两个数字放在一起,就是 2026 年 AI 在金融专业工作中的真实位置:它是一个非常好的初稿机,是一个非常差的终稿机。
再看失败模式的归因,这部分对做工程的人价值极高:
- 41% 是代码/公式 bug。 最典型的行为是调用了一个 python-pptx 里不存在的函数,报错之后不去修根因,而是直接把那行删掉——活儿看起来完成了,内容悄悄少了一块。这个行为模式我在自己的 agent 日志里见过太多次了。
- 27% 是业务逻辑错误。 比如把成本协同效应加到了收入端。这种错误最危险,因为它数值合理、格式正确、能跑通。
- 18% 是数据查询中断没回补。
- 13% 是直接编造缺失的数字并当作有来源。 论文里的例子:在 SEC 数据库里没查到,就凭空造了一组临床试验数据填进竞品分析。
还有一个细节值得所有做投研工具的人抄在本子上:Claude Opus 系列的产出”看起来”最专业,客户就绪度打分甚至是最高的,但打开 Excel 会发现关键数字大多是硬编码的常数而不是公式。 改一下收购价格,整张表纹丝不动——在投行语境里这是致命伤,因为情景分析直接失效。
能跑通 ≠ 能审计。这是我这两年在 AI 工程上学到的最贵的一课。
顺带对照一下厂商自己的口径。OpenAI 在其内部的初级投行分析师建模基准上,报告的分数是 GPT-5.1 的 59.1% → GPT-5.2 Thinking 的 68.4% → GPT-5.5 的 88.5%,在 FinanceAgent 上是 60.0%。能力确实在快速涨,这个不用怀疑。但厂商内部基准和第三方按真实交付物 rubric(平均 150 条标准、六个维度)打分,是两个世界。另一份 Vals.ai 与一家全球系统重要性银行合作的研究里,o3 在金融分析任务上的准确率只有 48.3%。
七、我自己在用的分工表
综合上面所有证据,我把投研链路上的活儿按两个维度分类:输出是否可机器验证、错了是否可逆。这张表是我们团队真实在用的版本:
| 象限 | 特征 | 典型场景 | 我的做法 |
|---|---|---|---|
| A:可验证 + 可逆 | 有 ground truth,错了立刻能发现 | 公告/财报结构化抽取、另类数据 parser、SQL 生成、回测脚本脚手架、单测生成、研报摘要 | 全量交给模型,配自动校验(schema 校验、数值对账、单测) |
| B:可验证 + 不可逆 | 能验证,但一旦执行代价高 | 生产环境代码、数据管道变更、指标口径调整 | 模型写,人 review,强制双人签发,绝不自动合并 |
| C:难验证 + 可逆 | 没有标准答案,但只是候选 | 因子想法生成、事件归因、调研纪要要点、行业图谱、假设枚举 | 只做候选生成,不做结论。产出必须进统计检验流程 |
| D:难验证 + 不可逆 | 没标准答案且一旦错就是事故 | 下单与仓位决策、风控阈值调整、客户适当性判断、对外合规文本定稿 | 不交。一行都不交。 |
这张表的分界线,和 BankerToolBench 的结论、和中基协标准里”智能体—人交互”这个范式,其实指向的是同一件事:把模型放在人类审阅回路的上游,而不是下游。
有人会问:这样效率提升还剩多少?我的经验数字是——A 象限的活儿能省 60% 到 80% 的时间,C 象限能把想法产出量提升一个量级但命中率不变(所以真正的瓶颈从”想不出来”变成了”验不过来”,你的回测算力和多重检验校正会成为新瓶颈),B、D 两个象限提升有限。整体大概是 20%–30% 的研究吞吐提升。这个数字不性感,但它是真的。
八、要落地的话,这六个坑请提前挖好
作为写代码的人,最后给点具体的。
1)Point-in-time 是生死线。 LLM 引入了一种传统量化没有的泄漏形式:训练集泄漏。模型”知道”2023 年发生了什么,你拿 2023 年的数据回测它对 2023 年的判断,得到的一切都是幻觉。Lopez-Lira 那篇论文之所以硬,就是因为它只用知识截止之后的样本。任何 LLM 因子的回测,第一件事是确认样本区间在模型 cutoff 之后。
2)可复现是硬约束,不是加分项。 prompt、模型版本、temperature、seed、工具返回的原始快照、检索到的文档 ID——全部入库,和信号值一起存。模型厂商随时会静默更新版本,你今天跑出来的因子,下个月可能复现不出来,而基金的合规和风控要求你必须能复现。我们的做法是把每次调用做成不可变记录,信号表里存 call_id 外键。
3)强约束输出,别解析自然语言。 一律走 JSON Schema / structured output,字段类型、取值范围、枚举全部约束死。解析失败直接丢弃并计数,把”解析失败率”当成一个必须监控的线上指标。
4)评估先于上线。 抄贝莱德:evaluation-driven development。先有评测集,再有功能;每日 CI 跑回归,防止模型更新后的静默退化。没有评测集就上线的 LLM 功能,本质上是没有单测的生产代码。
5)幻觉治理要放在输出侧,不是输入侧。 提示词里写一百遍”不要编造”没有用(BankerToolBench 里 13% 的编造就是证据)。有用的是输出后的独立校验:数字必须能回溯到某个 source id,回溯不到就打回;跨文档一致性做交叉检查(同一期营收在两页 PPT 里出现两个数,这种错必须被机器抓住)。
6)算清楚 token 成本和延迟对信号的侵蚀。 BankerToolBench 里单任务 539 次调用的数字很有代表性——agent 的成本是超线性增长的。而 190% 日换手那个教训告诉我们:信号的新鲜度和交易成本永远在打架。上线前请把”每个信号值的边际生成成本”算出来,很多看起来漂亮的策略死在这一行。
九、结语:奇效在哪里
回到标题这个问题。
ChatGPT 在基金领域的”奇效”,不是让机器学会了投资,而是解除了一个存在了一百年的约束——人类的信息处理带宽是固定的,而市场产生信息的速度是指数级的。
Lopez-Lira 那篇论文里有一个我很喜欢的洞察:市场对格式化数字定价高效,对需要上下文解读的信息定价低效。这个低效存在了几十年,不是因为投资者笨,而是因为没人读得完。LLM 第一次让”读得完”变成了一个成本问题而不是能力问题。
但也正因为它是成本问题,所以它会被迅速抹平——夏普从 6.54 到 1.22 的那条曲线,就是这个抹平过程的实时录像。
所以,如果你现在要在基金公司里推 AI,我的建议非常朴素:
- 别去卷”让 AI 选股”。 那是一个公开的、正在快速消失的机会,而且你的对手是全球所有拿同样模型的人。
- 去卷”让全公司提问变得便宜”。 贝莱德的答案是对的:把 LLM 做成自然语言到确定性系统的翻译层,把每个人的每一次好奇心,从”提需求排两周”变成”三十秒拿到答案”。
- 把模型放在人类审阅回路的上游。 桥水的答案是对的:让机器扩张假设空间,让统计和人做证伪。
- 把评测和可复现当成一等公民。 这是唯一能让 AI 从”炫技”变成”资产”的东西。
三年前我们以为 AI 会取代基金经理。
三年后我看到的事实是:AI 取代的是”没人读得完那些材料”这个借口。 而这,比取代任何一个人都更值钱。
更多推荐

所有评论(0)