AI智能体自动挖因子:广发金工复现CogAlpha全流程解析
strategy
知量团队
·
2026-06-19
·
8 分钟阅读
AI智能体自动挖因子:广发金工复现CogAlpha全流程解析
AI智能体自动挖因子:广发金工复现CogAlpha全流程解析
梵如谨科技 · 量化研究 · 2026-06-19
|
|
如果因子挖掘可以像跟AI对话一样简单——说一句"帮我找找量价背离的因子",它就自动生成、测试、迭代——你还会手动写因子代码吗?广发金工团队最近复现了CogAlpha,一个基于LLM的全自动因子挖掘AI智能体框架,我们来看看它到底怎么工作。
|
一、从手动到自动:因子挖掘的跃迁
传统的因子挖掘流程,本质上是研究员经验的延伸:基于对市场行为的观察,提出假设,编写公式,回测验证。这个过程高度依赖研究员的直觉和经验积累,一个经验丰富的金工研究员可能几年才能积累几百个有效因子。
CogAlpha的出现改变了这个格局。它把因子挖掘的"假设-验证"循环自动化了——用LLM替代研究员的大脑,用回测引擎替代研究员的手,形成一个24小时不间断运行的因子发现流水线。
传统挖因子
👨💻 研究员 → 💡 灵光一现 → ✍️ 编写公式 → 🖥️ 回测 → 🔄 手动迭代
产出:1-3个因子/周
|
CogAlpha模式
🤖 AI智能体 → 📊 数据输入 → 🔬 自动生成因子 → 📈 自动测试 → 🔄 自动迭代
产出:50-200个因子/轮
|
广发金工团队按照CogAlpha论文的方法,在A股市场独立复现了完整流程。他们用2023-2025年的A股数据做样本,验证了这套AI智能体框架在本土市场的有效性。这不是简单的论文复现——它是中文量化社区第一个完整公开的LLM因子挖掘实践案例。
|
二、CogAlpha的四个工作模块
根据广发团队的复现报告,CogAlpha由四个核心模块组成,构成一个完整的因子挖掘闭环:
模块1:数据接入层
接入日线/分钟线/财务/舆情等多源数据,标准化为统一Schema
|
模块2:因子生成器(LLM核心)
向LLM输入数据描述+挖掘目标,自动生成因子表达式。支持自然语言描述(如"找找开盘后30分钟量价背离的因子")
|
模块3:因子测试引擎
自动计算IC/IR/分组收益/换手率等,输出因子质量评分
|
模块4:迭代优化器
基于测试结果自动调整因子参数/表达式,迭代优化直到达到质量阈值
|
|
三、广发复现的关键发现
广发团队在复现过程中有几个值得关注的发现:
- LLM生成的因子多样性高于人工 — AI不会陷入思维定式,能找到一些人类很少关注的交叉模式
- 自然语言描述vs公式化描述 — 用自然语言描述因子逻辑时,LLM的生成质量更高,但这需要良好的Prompt工程
- 因子迭代需要人工干预 — 完全自动化迭代容易陷入"数据挖掘偏差",建议保留人工审查环节
- A股特色因子 — LLM自动生成的一些T+1/涨跌停板相关的因子显示出较高的IC,这是海外因子库没有的
|
四、对我们的启发:知源×CogAlpha
知源系统的核心能力是"知识的发现→吸收→变现"。CogAlpha代表的AI智能体自动因子挖掘,正好是知源体系中"知识发现"环节的自动化升级。
💡 可落地的方向
1. 将CogAlpha的因子生成prompt模式集成到知源的知识发现管道
2. LLM自动生成的因子→自动写入因子库→自动纳入策略质量监控
3. 构建A股专属的"AI因子发现→人工验证→策略落地"流水线
|
|
五、对抗式审查:关于AI挖因子的三个疑问
❓ 疑问1:LLM生成的因子会不会是过拟合的产物?
✅ 确实存在这个风险。CogAlpha的设计中包含了多维度验证:样本内/样本外分割测试、逐年滚动IC检验、以及随机标签测试(打乱标签后看是否仍有显著IC)。广发团队在复现中增加了A股特有的"时间序列交叉验证"来缓解过拟合。关键原则:LLM生成的因子必须经过严格的统计检验才能入库。
|
❓ 疑问2:AI因子挖掘和人工因子挖掘的实际效果差距有多大?
✅ 广发团队的对比测试显示:在同等计算资源下,AI智能体在3天内发现了127个候选因子,其中18个通过了IC显著性检验(IC均值>0.03)。同期人工组提出了23个候选因子,其中6个通过检验。AI的数量优势明显,但质量上限并未显著高于人工——顶尖研究员构造的因子仍然有最高的单因子IC。最佳策略可能是"AI做广度,人工做深度"。
|
❓ 疑问3:这种方法的实际部署成本高吗?
✅ 核心成本来自LLM API调用。广发团队估算每轮因子挖掘(生成+测试+迭代3轮)约消耗LLM token费用在20-50元人民币之间。相比一个资深金工研究员的日薪,这个成本完全可以接受。但如果要做大规模、高频率的因子挖掘,建议部署本地LLM以降低长期成本。
|
|
总结
广发金工对CogAlpha的复现是中文量化社区在AI因子挖掘领域的重要实践。它证明了LLM驱动的AI智能体可以大幅提升因子发现的效率,但同时也说明了"AI+人工"协同模式才是当前阶段最有效的路径。
对于知源系统而言,CogAlpha的方法论提供了一个很好的参考:如何将AI智能体嵌入到知识发现管线的自动化环节,让人工专注于更高价值的判断和决策。
⚠️ 本文基于广发金工团队公开研究成果整理。
AI生成的因子需经严格实盘验证,过往回测不代表未来收益。投资有风险。
|
|
|
📡 关于梵如谨科技
专注于A股量化因子研究与策略开发
因子库覆盖动量·趋势·量价·波动率·反转五大维度
每日自动扫描143+策略质量,监控衰减
📖 每月4篇深度内容 → 关注「梵如谨科技」
⚠️ 历史回测数据,不构成投资建议。投资有风险。
|
如果觉得有用,欢迎点赞、分享、收藏!
关注「梵如谨科技」,获取更多量化投资干货
|