引言:量化交易与生成式 AI 的范式重构
过去十年,量化交易一直是机器学习(ML)与统计建模的舞台——特征工程、因子挖掘、回归预测、组合优化,几乎每一步都在与"数值和概率"打交道。然而自 2023 年起,以 GPT-4、Claude、DeepSeek 为代表的大语言模型(LLM)开始悄悄进入这个领域。arXiv:2308.09687《Graph of Thoughts》表明,LLM 通过图结构推理已经能完成多步、可分解的复杂任务;arXiv:2311.01193《Contextual Confidence and Generative AI》则将"上下文置信度"引入生成式 AI 系统,提示我们可以让模型在"不确定时主动求助"。对于长期依赖人工经验的研究范式而言,这种能力意味着新的研究分工。
一、AI 在量化研究中的渗透切面
把 LLM 放进量化研究链条,第一个要回答的问题不是"它能做什么",而是"它在哪一环产生增量价值"。从 SSRN、arXiv 2024-2025 年的文献来看,LLM 的价值集中在以下几个切面——它们彼此并不互斥,而是同一研究流程上的不同环节。
1.1 因子库扩展:从经验驱动到语料驱动
传统因子依赖人类研究员长期经验,LLM 提供了另一种来源:通过对文献摘要、历史代码片段、数据字典的整合,批量生成候选因子。例如向模型输入"近 5 年美股月度数据中,分析师情绪类因子中表现最稳定的 10 个",模型会返回可执行的 Python 公式,并附带 IC、IR 的评估建议。需要强调的是,LLM 在这一环节的真正价值不是"想出新因子",而是显著降低了候选因子的初始筛选成本。
1.2 信号合成:从静态权重到动态叙事
信号合成阶段的难点不在于"算",而在于"为什么这个权重今天有效"。LLM 在这里扮演的角色更接近解释器:把价格、量价、基本面、新闻舆情、产业链数据按权重合成,并生成交易员能直接读懂的 memo。其真正的增量是让权重的动态调整具备可追溯的叙事,而不是单纯的历史最优拟合。
1.3 回测代码生成:节流与人工复核的边界
回测代码生成是 LLM 落地最快的场景之一。研究员每天可节省 3-4 小时机械代码时间。但这一价值必须伴随严格的复核机制:模型常因省略细节(如手续费、滑点、停牌处理)给出虚假的高收益。把"自然语言到代码"和"代码到可信结果"分开,是这一环节的隐性成本。
1.4 另类数据要素抽取的结构化挑战
财报、公告、研报、推文、监管文件——LLM 用统一 schema 抽取关键变量(营收超预期、关联交易、监管处罚),大幅提高另类数据处理效率。但结构化抽取的边界在于"标签体系的稳定性":一旦标签体系频繁调整,模型抽取的连续性会迅速失效。
1.5 风险归因与场景压力测试
输入组合持仓、因子暴露、历史极端行情,LLM 输出 top 5 风险因子、压力情景描述、对冲方案。这是天然适配 LLM 的场景,因为不涉及真实下单,更接近"模拟演练"。在严肃的对冲基金内部,这一环节往往决定 LLM 能否真正进入生产链路。
1.6 合规报告的格式固化与口径切换
面向监管、面向投委会、面向客户的不同口径报告,LLM 适合起草初稿,再由人工修订。关键不在模型的"写作能力",而在于格式模板的固化——一旦模板不严,模型会自由发挥,反而增加合规风险。
二、英文文献阅读范式的实际改变
国内做量化研究的一个核心痛点,是英文文献的密度远高于中文——arXiv 上的 q-fin.TR 类目每天几十篇新论文,Medium、Substack、Seeking Alpha、QuantStart 上又有大量实战分享。这种不对称结构在过去十年塑造了国内研究员的阅读习惯:依赖二手译稿、依赖导师解读、依赖小圈子分享。LLM 的出现改变了这一回路,但改变的方式比想象中更微妙。
2.1 检索阶段的范式变化
过去,研究员依赖 Google Scholar 与机构订购数据库;如今,cn.bing.com 配合 site: 限定符 + 时间窗口,已经能覆盖 80% 的日常检索需求。arXiv、Medium、SSRN、Towards Data Science 这几个站点构成英文文献的主要来源。检索本身不再是壁垒,真正的壁垒是"是否知道该用什么检索词"——而这点上和 LLM 的对话能力反而让检索词的组织变得更系统化。
2.2 摘要判断的隐性门槛
研究员拿到一篇英文论文后,第一遍只看摘要与结论图。这种跳过式阅读的隐性门槛在于"如何在 30 秒内判断一篇文章值不值得精读"。一般而言,可信的文献会明确给出数据集、时间窗口、基准对比与失效条件;缺失这些要素的文章,往往难以复现。在这一环节上,LLM 的价值不在于替代阅读,而在于帮助研究员把摘要里"含糊的结论"翻译成"具体的研究问题"。
2.3 知识沉淀的结构化代价
用 Notion 或飞书多维表格建"英文文献 → 中文笔记"的双向链接库,是近两年量化团队的标配。字段通常包括文献来源、作者机构、发布时间、核心方法、核心结论、关键数据、代码片段、可复用要素。这种沉淀方式的代价在于"持续维护成本"——一旦字段定义过细,反而抑制了笔记的产出频率。真正成功的实践往往在字段粒度上保持克制。
三、LLM 在量化研究中的局限性分析
把 LLM 放进量化研究链条,最大的误区是把"通用对话能力"等同于"领域理解能力"。直接问 LLM"推荐一个好用的量化策略",得到的答案大概率是教科书式泛泛而谈。以下从几个维度分析其目前的真实边界。
3.1 领域上下文的脆弱性
LLM 对"量化"的理解本质上来自训练语料中的统计规律,而非金融市场内生逻辑。这意味着它在面对"反常但真实存在"的市场状态时(如极端政策窗口、流动性骤变、跨市场传染)容易给出表面合理但实际错误的判断。研究员的角色因此不会被替代,反而需要承担对模型输出的"反向验证"这一新职责。
3.2 提示词的工程化并非万能
一种常见做法是把"角色 + 数据 + 格式"作为提示词三件套:
角色:你是一名有 8 年 A 股量化经验的资深研究员。
数据:日频,2015-2024,包含开盘价、最高价、最低价、收盘价、成交量、
换手率、北向资金日净流入、行业申万一级分类。
任务:找出能解释下个月相对收益最强的 3 个因子。
约束:
- 每个因子必须有清晰的金融经济学解释;
- 不能使用未来信息;
- 因子值需能在 1 分钟内计算完;
- 输出 IC、IR、top-bottom decile 年化收益差。
格式:表格 + 因子定义 + 数据计算公式(Python) + 显著性检验。
三件套确实能显著降低幻觉,但从实际项目经验看,过度工程的提示词反而会让模型陷入"语义模仿"陷阱——输出格式完美,但核心结论仍然是训练语料的拼接。真正有效的方式是把提示词当作"研究直觉的脚手架"而非"答案的生产线"。
3.3 人机循环的隐性成本
一种进阶的做法是建立"研究员 + LLM 对话循环":模型先给出因子定义,研究员反馈已有研究指出该因子被验证过;模型基于反馈再次给出新定义;最后筛选出 3 个全新因子进入回测;回测异常时让模型解释原因并反复迭代。这种循环确实加速了因子筛选,但其隐性成本在于"反馈语义"的标准化——如果研究员每次反馈的颗粒度不一致,模型反而会陷入"满足最近一次反馈"的局部最优。
四、回测代码生成的实战陷阱
LLM 生成回测代码最大的"坑"不是语法错,而是它会把工程上的细节当成业务上的常识省略掉。下面几个坑 90% 的 LLM 都会踩到。
4.1 隐藏的前视偏差(Look-ahead Bias)
LLM 经常在因子计算公式里"无意"用了未来信息:例如它计算"次日开盘涨幅"时,会用当天的收盘价作为输入,但实际上次日开盘价由集合竞价决定,与收盘价相关性并不固定。LLM 的训练语料里到处都是"以收盘价代表次日"的简化写法,模型会原样照搬。应对方法:在 prompt 里强制要求"任何因子的输入数据必须严格早于输出时点",并在代码 review 阶段逐行查 time index。
4.2 交易成本估算偏低
LLM 默认的交易成本是"双边千一"或"双边万二",但 A 股真实的成本包括:印花税(卖出 0.1%)、过户费、券商佣金、冲击成本(对中盘以上股票 0.05%-0.2%)。冲击成本是模型最难估算的,因为它依赖订单簿微观结构。应对方法:把交易成本拆成"固定成本 + 规模敏感成本",规模和换手率挂钩,让模型只能估不能猜。
4.3 缺失停牌、退市、ST 处理
LLM 经常会写出"每日开盘价买入、收盘价卖出"的代码,完全忽略停牌日、退市股、ST 涨跌停限制等中国特色规则。应对方法:明确给出"事件清单",要求模型在每个交易日检查"是否可交易"。
五、风险与合规:AI 量化的"幻觉陷阱"
LLM 最大的系统性风险是"幻觉"——它会一本正经地编造不存在的论文、不存在的 API、不存在的指标定义。在量化场景下,幻觉可能直接导致财务损失或合规事故。
5.1 数据幻觉(Data Hallucination)
LLM 经常报"某因子 IC=0.08, IR=2.3"这种数字,但实际查 SQL 根本不存在这些数据。模型是基于统计规律"猜"出数字的,永远不要直接相信 LLM 给出的数据。应对方法:所有 LLM 给出的数据必须回原始数据源(数据库/Excel/BI)核对。
5.2 代码幻觉(Code Hallucination)
LLM 会调用不存在的库函数(如 df.rolling_ic())、不存在的 API(如 jqdatasdk.get_alpha_factors())。运行报 NameError 才被发现。应对方法:让 LLM 只用你指定的库(pandas/numpy/ta-lib),禁用未审核的第三方包。
5.3 引用幻觉(Citation Hallucination)
LLM 在严肃研究中给出的论文引用必须人工核对原文 DOI。常见的幻觉模式有:作者名错位、期刊年份错位、结论与原文不符。
5.4 监管合规
境内私募使用 LLM 涉及《生成式人工智能服务管理暂行办法》。要点:训练数据来源合规、生成内容标识、用户输入隐私保护、上线前安全评估。
六、落地路径:从 PoC 到生产的 4 个里程碑
任何 AI 量化项目从立项到稳定运行,至少要经过以下 4 个阶段:
- 概念验证(PoC):1-2 周,用 LLM 跑通一个因子或一个策略的回测,验证技术可行性。
- 影子运行(Shadow Mode):4-8 周,LLM 生成的信号不参与真实交易,只与人工策略并行运行,对比差异。
- 小仓位实盘(Pilot):8-12 周,LLM 信号参与 5%-10% 仓位的真实交易,人工兜底。
- 全面生产(Production):3-6 个月,LLM 信号占 30% 以上仓位,建立监控、复核、应急机制。
跳过任何一个阶段直接落地,是大多数 AI 量化项目翻车的主因。
七、工具栈选择:开源 vs 商业 API
目前主流选择分两类:
- 开源本地部署:Qwen2.5、DeepSeek-V3、Llama-3.1,配合 vLLM 或 Ollama。优点:数据不出本地、长期成本低;缺点:硬件投入大、需要专职 AI 工程师。
- 商业 API:OpenAI、Anthropic、智谱。优点:上手快、模型能力强;缺点:数据出境、长期成本高、存在合规风险。
国内中小私募的现实选择:境内开源小模型(如 Qwen2.5-72B)做数据预处理 + 商业 API 做复杂推理。前者解决合规问题,后者解决能力问题。
八、常见问题(FAQ)
Q1:LLM 生成的因子会不会和已有因子重复?
A:会。LLM 的训练语料里包含大量公开因子库,模型倾向于"重新组合"已知因子。识别方法:把候选因子与自家因子库、Fama-French 因子库做相关性矩阵,IC > 0.3 视为高度重复。
Q2:如何评估 LLM 量化项目的 ROI?
A:核心指标是"单位人力产出"。计算公式:(使用 LLM 后的人力 × 策略数量) / (使用 LLM 前的人力 × 策略数量)。如果 < 0.5,说明 LLM 真的有效;如果 > 0.8,说明只是表面热闹。
Q3:LLM 会不会取代量化研究员?
A:不会。LLM 替代的是"机械代码"和"资料整理",研究员的核心工作——策略直觉、风险判断、跨市场联想——反而因为 LLM 的"幻觉"变得更稀缺。
九、结论
AI 在量化交易中的角色,本质上是"研究员的放大器"而不是"研究员的替代者"。真正能落地的团队,是把 LLM 用在了研究员不愿做、不屑做、做不过来的环节——代码生成、文献整理、初稿撰写——而不是用它直接生成"会赚钱的策略"。
2025-2026 年,LLM 在量化领域的渗透会继续加深,但不会颠覆量化研究的核心方法论。真正稀缺的是"懂 LLM 又懂量化"的复合人才,而不是 LLM 本身。
参考资料(References)
- arXiv:2308.09687. Graph of Thoughts: Solving Elaborate Problems with LLMs. 2023.
- arXiv:2311.01193. Contextual Confidence and Generative AI. 2023.
- Towards Data Science. Using LLMs for Quantitative Finance. 2024-2025 系列文章.
- SSRN. Machine Learning in Risk Management for Quantitative Funds. 2024.
- Medium / Substack 量化从业者系列工作流文章(2024-2025)。
