#22040
混合
免费
ID-940_量价分布集中度均匀吸筹选股研究报告
公式说明
AI生成
一句话概括:这个公式用量价分布的"均匀度"找机构持续吸筹、而非游资脉冲拉抬的股票。 核心买入逻辑:用赫芬达尔集中度刻画20日成交量和收益的时间分布,要求量能分布均匀(VCONC低于1.6)、比5日前更均匀、收益分布均匀(RCONC低于2.2)、且短期均量抬头价格站上20日线,四项至少满足三项;再叠加波动低于9%、距20日高点有3%空间、量能温和、当日涨幅0到5%。 适合市场环境:震荡上行或温和爬坡的吸筹期,机构缓慢建仓阶段最有效,不适合游资脉冲妖股。 风险提示:均匀吸筹也可能长期不涨或假吸筹,需结合趋势确认并设止损。
研究报告
# ID-940 量价分布集中度均匀吸筹选股 研究报告
- **公式ID**: FORMULA-940
- **生成时间**: 2026-08-03 04:00-04:30 (Asia/Shanghai)
- **提示词版本**: v4.5(统一合并版)
- **通道**: 纯发散通道(next_id 940,940 mod 5 = 0 落在 {0,1,2})
- **信号家族**: 尾部分布 / 分布形状(Herfindahl-Hirschman 集中度)
- **Warmup**: 30 根 K 线
- **执行假设**: T 日收盘计算信号,T+1 日开盘执行
---
## 逻辑链说明
**市场背景**:当前市场状态检测为震荡市(sideways)。震荡市里"幅度类"指标(放量、涨幅、突破)失真严重——一根消息刺激的大阳线就能把量比、涨幅、突破指标全部点亮,但次日往往回吐。真正稀缺的信息不在"涨了多少",而在"这段涨幅是怎么堆出来的"。机构建仓的典型痕迹是**把成交量摊平在多个交易日**(避免冲击成本),而游资/消息驱动的典型痕迹是**能量高度集中在一两根 K 线**。全库 1750 个公式中,几乎所有量能指标都在测幅度(VOL/MA(VOL,N)、量比、OBV),**没有一个在测分布形状**——这就是本次选向的真空地带。
**信号设计**:引入产业经济学中的 Herfindahl-Hirschman 指数(HHI)度量能量在时间维度上的分配集中度。
- `VCONC = 20 * SUM(VOL^2,20) / SUM(VOL,20)^2`:成交量集中度。数学上等于 `20 * E[V^2]/E[V]^2 = 20 * (1 + CV^2)`,取值区间 [1, 20]。VCONC=1 表示 20 天成交量完全均匀;VCONC=20 表示所有成交量集中在单日。
- `RCONC = 20 * SUM(|RET|^2,20) / SUM(|RET|,20)^2`:日收益绝对值集中度,同构定义。低值表示区间涨跌由多根小幅 K 线累积(结构性上行),高值表示由一两根跳空大阳堆出(事件驱动)。
四维投票(3 选 3,门槛偏严):
- S1 `VCONC < 1.60`:量能分布均匀,20 日成交量未被单日脉冲主导
- S2 `VCONC < REF(VCONC,5)`:集中度在收敛,脉冲退潮、资金转为持续渗透(一阶导方向)
- S3 `RCONC < 2.20`:收益分布均匀,排除跳空型上涨
- S4 `MA(VOL,10) > MA(VOL,20) AND CLOSE > MA(CLOSE,20)`:量价同步抬升,排除"缩量阴跌导致的被动均匀"这一致命退化情形
**确认机制**:四重门控过滤假信号。
- G1 `ATRV/CLOSE < 0.09`:日均振幅占比低于 9%,剔除妖股高波动样本
- G2 `CLOSE < HHV(HIGH,20) * 0.97`:距 20 日最高价保留 3% 空间,买在中继而非顶部
- G3 `0.8 <= VOL/MA(VOL,20) <= 2.5`:当日量能正常区间。既排除无人问津的缩量,也排除"当日爆量"——后者会在下一根 K 线直接破坏 VCONC 的均匀前提,属逻辑自洽性约束
- G4 `1.00 < CLOSE/REF(CLOSE,1) < 1.05`:当日温和上涨 0%~5%,避免涨停板无法成交
**风险控制**:G1 波动率上限 + G2 位置上限 + G4 涨幅上限构成三重风险边界。回测采用系统统一持有期规则(实测平均持有 5.88 天),公式本身不内嵌止损语句(通达信选股公式框架限制),风控依赖入场位置的严格性。VaR95 -28.8% / CVaR95 -34.6% 提示尾部风险显著,实盘需外挂止损。
---
## A. 实现细节(Implementation Details)
### A1 公式逻辑
| 层 | 组件 | 表达式要点 | 设计意图 |
|---|---|---|---|
| 核心 | VCONC | `20*SUM(V^2,20)/SUM(V,20)^2` | 成交量时间分布集中度,[1,20] |
| 核心 | RCONC | `20*SUM(AR^2,20)/SUM(AR,20)^2` | 收益时间分布集中度,AR=\|RET\| |
| 投票 S1 | 静态阈值 | VCONC<1.60 | 均匀吸筹(对应变异系数 CV<0.775) |
| 投票 S2 | 一阶导 | VCONC<REF(VCONC,5) | 集中度收敛趋势 |
| 投票 S3 | 静态阈值 | RCONC<2.20 | 收益结构性而非事件性 |
| 投票 S4 | 量价确认 | MA(V,10)>MA(V,20) AND C>MA(C,20) | 排除被动均匀退化 |
| 门控 G1 | ATRV/CLOSE<0.09 | 波动率上限 | 剔除妖股 |
| 门控 G2 | C<HHV(H,20)*0.97 | 位置上限 | 不追高 |
| 门控 G3 | 0.8~2.5 倍均量 | 量能区间 | 逻辑自洽 |
| 门控 G4 | 涨幅 0%~5% | 可成交性 | 避免涨停 |
投票门槛 `VOTE >= 3`(3-of-4),用 `IF(cond,1,0)` 求和实现,规避 OR 语义在解析器间的歧义。
### A2 执行时点
T 日收盘后计算全部指标 → 信号成立 → T+1 日开盘买入。所有引用均为 `REF`、`SUM(...,20)`、`MA`、`HHV` 等历史窗口函数,无 `REF(X,-1)` 类未来引用。
### A3 Warmup 周期
最大窗口链:`SUM(...,20)` 需 20 根;`REF(VCONC,5)` 在 VCONC 之上再退 5 根 = 25 根;`MA(CLOSE,20)`/`HHV(HIGH,20)` 需 20 根。取保守值 **30 根**,第 31 根 K 线起生成信号。指标评估(夏普/最大回撤)由回测引擎在 Warmup 切片之后计算。
### A4 适用市场
A 股全市场(沪深主板/中小创),日线级别。逻辑上更适配**中低波动、有机构参与的中大市值标的**;G1 波动率门控天然过滤了微盘妖股。不适用于港股(T+0 与做空机制改变量能分布语义)与美股。
### A5 回测结果(真实本地 CSV 数据)
样本窗口:2025-06-10 ~ 2026-05-25(232 交易日),全市场扫描 10,027 只代码,实际有本地数据并产生信号 **106 只**。
| 指标 | 方案 A | 方案 B |
|---|---|---|
| 扫描 / 有信号 | 10,027 / **106** | 10,027 / **106** |
| 总交易笔数 | 1,163 | — |
| 胜率(简单截面平均) | **49.65%** | **49.65%** |
| 胜率(交易加权) | 49.18% | — |
| 平均总收益 | **+4.854%** | **+4.854%** |
| 正收益股占比 | 55.66%(59/106) | 55.66%(59/106) |
| 平均最大回撤 | -14.57% | — |
| 最差最大回撤 | -44.0% | — |
| 盈亏比(截尾 50) | **1.533** | — |
| 盈利因子 PF | **1.92** | — |
| 夏普(截面) | 0.213 | — |
| VaR95 / CVaR95 | -28.8% / -34.62% | — |
| 平均持有天数 | 5.88 天 | — |
**七项指标齐全**:胜率 ✅ 收益率 ✅ 最大回撤 ✅ 夏普 ✅ VaR ✅ CVaR ✅ 盈利因子 ✅
### A6 A/B 交叉验证结论
| 对比项 | 方案 A | 方案 B | 差异 | 判定 |
|---|---|---|---|---|
| 胜率(简单截面) | 49.65% | 49.65% | **0.00pp** | ✅ 一致(<5pp) |
| 平均收益 | +4.854% | +4.854% | **0.00pp** | ✅ 一致,符号相同 |
| 有信号股票数 | 106 | 106 | 0 | ✅ 一致 |
| 正收益股数 | 59 | 59 | 0 | ✅ 一致 |
两套完全独立的解析器(A: `backtest.parser + backtest.evaluator`;B: `tdx_interpreter`)产出完全相同的信号序列,说明公式**语义无歧义**,不存在解析器依赖的实现风险。交易数非 0,公式有有效信号。
### A7 强制自检 4 步
1. **是否使用未来数据**:❌ 无。全部为 `SUM/MA/REF/HHV/LLV` 历史窗口,无 `REF(X,-1)`、无 `ZIG`、无 `FORCAST`。信号在 T 日收盘计算、T+1 开盘执行,无 Look-Ahead。
2. **MA/EMA/SMA 是否在 Warmup 后判断**:✅ 是。Warmup=30 已覆盖最长依赖链(VCONC 的 SUM20 套 REF5 = 25)。引擎在 Warmup 切片后计算评估指标。
3. **是否参数过拟合**:⚠️ 部分风险。VCONC 阈值 1.60、RCONC 阈值 2.20 为一次成型未搜参(属"未过拟合"而非"已证稳健")。跨股票胜率波动区间 42.9%~81.8%,离散度较大,需网格敏感性验证。参数总数 4 个阈值 + 4 个门控,属中等复杂度,未做多参数联合优化。
4. **是否夸大宣传**:❌ 无。本报告明确标注为**样本内**回测(2025-06-10~2026-05-25 单一窗口),非样本外验证。胜率 49.65% 如实呈现,不做修饰。
---
## B. 已知偏差(Limitations and Bias)
### B1 数据窗口偏差(最关键)
本地 CSV 仅覆盖 **2025-06-10 ~ 2026-05-25(232 日)**,扣除 30 根 Warmup 后剩约 202 日。虽然 106 只股票 / 1163 笔交易的样本量远超 MIN_TRADES=5 护栏,但**单一市场周期**(该窗口整体为震荡偏强)意味着结论无法外推到熊市或单边急跌环境。10,027 只代码中 9,921 只无本地数据(errors),实际测试池只有 106 只,**存在严重的股票池选择偏差**——这 106 只是历史上被下载过 CSV 的样本,非随机抽取。
### B2 尾部风险显著被低估的表述风险
VaR95 = -28.8%、CVaR95 = -34.62%、最差最大回撤 -44.0%。这意味着**尾部 5% 的情形下单只股票会亏掉三成以上**。虽然 PF=1.92、盈亏比 1.533 显示整体正期望,但这个正期望是靠右尾(最佳 +117.3%)拉起来的,分布高度右偏。若实盘无外挂止损,单只重仓遭遇左尾即造成不可逆损失。**"分布均匀"筛的是入场时的能量分布,不保证持有期的收益分布也均匀**——这是本公式最反直觉的一点。
### B3 参数敏感性未验证
VCONC < 1.60 这个阈值的经济含义是变异系数 CV < 0.775。为什么不是 1.5 或 1.8?目前没有网格扫描证据。同理 RCONC < 2.20、REF 窗口 5、SUM 窗口 20 均为一次设定。跨股票胜率从 42.9% 到 81.8% 的巨大离散度,暗示公式对标的特性敏感(可能与流动性、市值高度相关),**参数在不同流动性分层上可能需要差异化**。
### B4 市场适应性
S4 的 `MA(VOL,10)>MA(VOL,20) AND CLOSE>MA(CLOSE,20)` 是本公式的趋势依赖点。在**持续单边下跌**行情中,S4 几乎永远不成立,3-of-4 门槛将极难达成,公式会长期空仓(这是安全的失效模式)。但在**低量横盘**行情中,VCONC 天然偏低(因为每天量都很小且均匀),S1/S2/S3 容易同时成立,可能产生大量"僵尸股"信号——G3 的 0.8 倍均量下限与 S4 的量能抬头是唯一防线,可能不够。
---
## C. 结果解读(Result Interpretation)
### C1 逻辑质量
信号具有明确的**经济学微观结构含义**:Herfindahl 集中度直接对应"资金是分批渗透还是一次性冲击"这一可观测的交易行为差异。这不是数据挖掘出来的相关性,而是从做市/建仓成本理论推导出来的——机构为降低冲击成本必然分散下单,这在日线聚合后表现为成交量的低时间集中度。逻辑链可以完整向他人解释,不依赖"因为回测好所以有用"的循环论证。
### C2 创新点
全库 1750 个 `.tn` 文件覆盖探针结果:`HHI` 0 次、`HERFINDAHL` 0 次、`DISPERSION` 0 次、`QUANTILE` 0 次、`集中度` 0 次、`GINI` 2 次。**本公式是全库第一个用分布集中度(二阶矩比值的归一化形式)刻画量价的公式**。与最接近的已有维度对比:
- 与"量比/放量"(覆盖数十次)本质不同:量比测**当日幅度**,HHI 测**整段窗口的能量分配形状**
- 与 `STD`/波动率类(ATR 覆盖大量)本质不同:标准差是绝对尺度量纲,HHI 是**无量纲的形状指标**,不受价格水平和绝对成交量规模影响,天然可跨股票比较
- 与 Hurst(11 次)不同:Hurst 测长记忆的多尺度自相似性,HHI 测**单窗口内的分配不均匀度**,无尺度递归
语义去重相似度 **4.34%**(阈值 60%),对抗式新颖性 **1.00**(阈值 0.7)——两项指标均为近期最优,客观支持"新维度"判定。
### C3 风险点
最大风险是 **B2 描述的右偏分布依赖**:整体正期望(PF 1.92)建立在少数大赢家上,胜率仅 49.65% 意味着**超过一半的交易是亏钱的**。这类策略在实盘中极难执行——连续 5~6 笔小亏后交易者往往会放弃,而恰恰放弃后错过了那笔 +117% 的大赢家。控制方式:必须**分散持仓**(同时持有 15 只以上)让大数定律生效,并**严格执行固定持有期**(回测的 5.88 天)不做主观干预。
### C4 适用场景
最适合**量化分散型投资者**:能同时持有 15~30 只、机械执行固定持有期、接受不到 50% 胜率的人。不适合集中持仓或依赖单笔盈利体验的主观交易者。作为组合信号的一个**正交因子**价值更高——HHI 与几乎所有现有维度(趋势、动量、形态、波动率)在数学上都不共线,是理想的投票成员候选。
### C5 改进方向
1. **网格敏感性扫描**:对 VCONC 阈值 [1.4, 1.5, 1.6, 1.7, 1.8]、RCONC 阈值 [1.8, 2.0, 2.2, 2.4]、SUM 窗口 [10, 20, 30] 做三维扫描,验证 1.60/2.20/20 是否落在稳健平台区而非孤立尖峰
2. **拆成独立材料节点**:把 VCONC、RCONC 作为两个独立材料注册到 `formula-recipes.json`,与 momentum_heavy / meanrev_heavy / price_heavy 家族做跨家族 N-of-M 组合。基于 C2 的正交性论证,这可能是本公式最大的价值所在
3. **加入外挂止损层**:针对 B2 的尾部风险,尝试在公式内加入 `CLOSE > REF(LLV(LOW,10),1)` 类结构性止损条件,观察是否能把 CVaR95 从 -34.6% 收敛到 -25% 以内(代价是牺牲部分右尾)
4. **流动性分层测试**:按平均成交额分 3 层分别回测,验证 C3 猜测的"参数需按流动性差异化"
### C6 对抗式审查
我主动怀疑了以下 4 个点,并逐一排除或标注:
1. **怀疑:VCONC 是不是只是"成交量标准差"的换皮?**
排除:数学上 `VCONC = 20*E[V^2]/E[V]^2 = 20*(1+CV^2)`,其中 CV 是变异系数。它是 **CV 的单调变换而非 STD 的变换**——STD 是有量纲的(受绝对成交量规模影响,贵州茅台和一只小盘股无法比较),VCONC 是**无量纲归一化**的,可以跨股票直接横向比较。这个差别在多股票投票场景下是本质的,不是换皮。此外全库 `STD` 在方案 A 解析器中甚至不被支持(仅方案 B 支持),说明现有公式几乎不用标准差族。
2. **怀疑:胜率 49.65% 低于 50%,这个公式是不是根本无效?**
部分排除,需诚实标注:胜率确实略低于 50%,但 **PF=1.92、盈亏比=1.533、正收益股占比 55.66%、平均收益 +4.854%** 四项指标均为正期望。这是典型的**低胜率高赔率**画像,与纯趋势公式的高胜率低赔率画像互补。按 v4.5 拓扑自进化框架第 3 条铁律"回测仅作粗筛,禁止单公式胜率<50% 即删除"——本公式作为材料节点入库合法。但**不应加入 effective_logics**(该门槛要求胜率 >50%),本次不加。
3. **怀疑:是否和现有公式重复?**
排除:ChromaDB 语义相似度 **4.34%**(阈值 60%,为近期最低值之一),对抗式新颖性 **1.00**。1750 个 `.tn` 文件关键词探针中 HHI/HERFINDAHL/DISPERSION/集中度 全部 0 命中。三重独立证据一致。
4. **怀疑:S4(量能抬头 + 站上均线)会不会才是真正起作用的因子,HHI 只是搭便车?**
**未能排除,标注为待验证**。这是本公式最严重的未解风险。S4 是一个常见的量价趋势条件,在 3-of-4 门槛下,S4 + 任意两个 HHI 条件即可触发。要证明 HHI 有独立贡献,必须做**消融实验**:分别回测 (a) 仅 S4+四门控、(b) 完整 3-of-4、(c) 仅 S1S2S3 投票 2/3 + 四门控,对比三者的胜率/PF。本次未做,诚实记录为 gen2 的首要任务。**在消融实验完成前,不应宣称"HHI 维度已验证有效",只能宣称"HHI 维度已可计算且不破坏原有信号质量"。**
---
## 质量门汇总
| 检查项 | 门槛 | 本公式 | 结果 |
|---|---|---|---|
| R01-R05 规则验证 | 全部通过 | validator 通过,复杂度 5 星 | ✅ |
| 逻辑链说明 | ≥100 字,4 要素齐全 | 约 900 字,市场背景/信号设计/确认机制/风险控制齐全 | ✅ |
| 多样性得分 | ≥3(3+ 类指标融合) | 分布形状 + 量能 + 趋势 + 波动率 = 4 类,5 星复杂度 | ✅ |
| 语义去重相似度 | <60% | **4.34%** | ✅ |
| 对抗式新颖性评分 | ≥0.7 | **1.00** | ✅ |
| Warmup 标注 | 已标注 | 30 根,公式头部注释已写 | ✅ |
| 对抗式审查怀疑点 | ≥3 个 | **4 个**(含 1 个诚实未排除) | ✅ |
| A/B/C 三段结构 | 齐全 | 齐全 | ✅ |
| A/B 交叉验证 | 差异 <5pp | **0.00pp** | ✅ |
| 回测数据真实性 | 禁止编造 | 本地 CSV 真实行情,106 股 1163 笔 | ✅ |
---
## 结论
FORMULA-940 在全库首次引入 **Herfindahl-Hirschman 分布集中度**这一无量纲形状维度,填补了"所有量能指标都在测幅度、无一测分布形状"的空白。回测显示低胜率(49.65%)高赔率(PF 1.92)画像,A/B 双解析器 0.00pp 完全一致,语义去重 4.34% 与新颖性 1.00 三重支持新维度判定。
**核心保留意见**:S4 消融实验未做,HHI 的独立贡献尚未证实。本公式按拓扑自进化框架作为**新材料节点入库**(不删差公式、不加 effective_logics),其最大价值预期在于与 momentum/meanrev/price 三大家族做跨家族正交组合,而非单独使用。
回测统计
胜率
---
平均收益
---
夏普比率
待验证
最大回撤
-0.0%
按市场状态分段表现
暂无市场状态数据