← 返回报告库
KHI v2 · 四次崩盘 · 经济学检验 · 负知识
KHI 能预示崩盘吗?
四种事故,不能只装一根表针
这篇报告只回答三个问题:市场集中以后,风险会不会变大?开始破裂以后,能不能预测后续收益?这个公式为什么这样写?我们用 2015—2026 年、131 个申万二级行业、326,208 个日频和 68,592 个周度观测重新检验。答案很清楚:集中能提示左尾风险;“集中后破裂”仍不能稳定预测负收益;现行三项公式有经济含义,但不是样本内预测最优。
动态历史成员|日频复核 + 周频稳健性|行业/时间双固定效应|Fama–MacBeth|双向聚类标准误|多期限左尾|安慰剂位移|费后风险覆盖层|数据至 2026-08-25
6.11% vs 4.92%高脆弱区 vs 其余区域未来20日最大回撤
1.56×15%尾部回撤精确率相对基础率提升
β 0.043控制波动/动量/既有回撤后,双固定效应 t=5.28
+1.4% vs +1.3%高脆弱区未来平均收益没有下降
−3.2pp CAGR机械风险覆盖层费后收益拖累
先说结论。它更像一盏风险黄灯,不是一张卖出指令。高脆弱行业未来会经历更大的途中回撤,但平均收益并没有变差;即使价格和广度已经破裂,后面也常有反弹。最合理的用途是少追高、降集中、加强复核,而不是自动清仓或做空。
一、命题:为什么“拥挤”可能产生非线性左尾
“涨得多”本身不会必然带来下跌。真正危险的是:很多资金用相似的理由持有相似的资产,却都把日常成交量误当成自己的退出流动性。上涨时,这种一致性会推高价格;压力来临时,所有人同时卖,流动性就会突然消失。
共同因子耦合行业收益被同一主成分支配,分散化保护变薄。
持仓/交易集中边际价格越来越依赖少数行业或龙头。
流动性错配日常成交活跃,不等于所有人同时退出时有深度。
反身性上涨吸引资金,资金推高价格;下跌时反馈方向反转。
理论基线:Greenwood–Thesmar 的股票价格脆弱性把所有权集中和投资者流动性冲击联系起来;Coval–Stafford 的股票火售说明被迫交易会造成价格压力;Brunnermeier–Pedersen 的融资流动性与市场流动性解释了为何冲击会自我强化。KHI 的合理定位正是这些机制的市场代理,而不是自然定律。
二、公式:KHI v2 不再追求一个万能总分
指标分三层。第一层看全市场是否越来越同步;第二层找出成交、龙头结构和相对强势同时升温的行业;第三层只确认价格与广度是否已经破裂。把“危险状态”和“破裂动作”分开,是整套设计最重要的约束。
1. 系统耦合层
\[ AR_t=\frac{\lambda_{1,t}}{\sum_{j=1}^{N}\lambda_{j,t}} \]吸收比率:第一主成分解释的行业总方差比例。越高,市场越像“同一笔交易”。
\[ \bar{\rho}_t=\frac{2}{N(N-1)}\sum_{i<j}\rho_{ij,t} \]平均行业相关:越高,跨行业分散越难提供保护。
\[ KHI^{\mathrm{sys}}_t=100\left[0.6\,\operatorname{Rank}(AR_t)+0.4\,\operatorname{Rank}(\bar\rho_t)\right] \]这是描述性复合表针。历史上 AR 单项更有效,所以页面保留并突出原始吸收比率。
2. 行业危险区域
\[ Share_{i,t}=\frac{Amount_{i,t}}{\sum_j Amount_{j,t}},\qquad P_{i,t}=\operatorname{Rank}_{756}(Share_{i,t}) \]成交参与度:这个行业吸收的市场成交额,处在自己近三年历史的什么位置。
\[ Gap_{i,t}=MA_{20}\!\left(r^{cap}_{i,t}-\operatorname{Median}_{k\in i}(r_{k,t})\right),\qquad G_{i,t}=\operatorname{Rank}_{756}(Gap_{i,t}) \]龙头裂口:市值加权表现是否越来越依赖少数大权重股。
\[ RS_{i,t}=R^{60d}_{i,t}-R^{60d}_{market,t},\qquad M_{i,t}=\operatorname{Rank}_{756}(RS_{i,t}) \]相对强势:行业是否持续跑赢全市场。
\[ V_{i,t}=100\left(P_{i,t}G_{i,t}M_{i,t}\right)^{1/3} \]几何平均不会让一个极高分完全掩盖另外两个普通分。它是“结构诊断分”,不是统计最优预测器;消融结果见第五节。
3. 破裂确认与区域记忆
\[ D_{i,t}=\operatorname{Clip}\!\left(\frac{-R^{5d}_{i,t}}{8\%},0,1\right),\qquad B_{i,t}=\operatorname{Clip}\!\left(\frac{50\%-Breadth^{5d}_{i,t}}{25\%},0,1\right) \]
\[ T_{i,t}=100\max\!\left\{\sqrt{D_{i,t}B_{i,t}},\ T^{shock}_{i,t}\right\} \]Trigger 同时要求价格受损和上涨家数收缩;单日极端冲击另设旁路。它描述“已经开始破”,不是“将要破”。
\[ Z_{i,t}=\max_{0\le k<60}V_{i,t-k},\qquad Risk_{i,t}=\sqrt{Z_{i,t}T_{i,t}} \]60 日记忆保留“此前曾高度拥挤”的状态,避免刚跌下来后 V 机械回落、风险却被误判为消失。
三、四次事故:同一个“崩”,四种病理
| 事件 | 代理回撤 | 峰前20日证据 | 真正有效的表针 |
2015 杠杆去化 06-12→07-08 | −51.3% | AR60 0.708、平均相关0.694;Top5成交仅19.9% | 系统耦合,不是行业集中 |
2021 核心资产 02-10→03-25 | −15.2% | 系统AR仅8分位;能源金属99.7、电池97.2、白酒97.0 | 行业/主题脆弱度 |
2024 微盘踩踏 01-02→02-07 | −33.4% | AR60 75分位、平均相关76分位;Top5集中仅39分位 | 系统耦合 + 大小盘割裂 |
2026 半导体 06-30→07-30 | −39.2% | 峰前20日Top5/HHI均98分位;半导体96.8 | 行业脆弱度 + 集中度 |
最重要的识别结果。2015和2024都不是典型行业抱团崩:2015是广泛杠杆与系统同步,2024是微盘流动性/风格事故;2021和2026才是局部拥挤交易反转。一个总 KHI 必然在某些事故上失灵,正确结构是系统KHI管共同耦合,大小盘割裂管风格抽血,行业V管局部拥挤,Trigger只管是否已破裂。
2015预热限制。本地全市场数据从2015年1月开始,6月峰值前不足252个交易日,更不可能形成三年历史分位。因此2015只报告原始AR60、平均相关和集中度,绝不把短窗口排名伪装成可与2021/2026比较的“99分”。
四、预测检验:它预测左尾,不预测均值
先检验危险区域 V。周频结果是稳健的基准;真正的破裂信号还要回到日频。我们的主要目标不是期末收益,而是从今天起、途中最深会跌多少:
\[ Loss^{h}_{i,t}=\max_{1\le k\le h}\left(1-\frac{Price_{i,t+k}}{Price_{i,t}}\right) \]
\[ Loss^{20}_{i,t}=\alpha_i+\gamma_t+\beta V_{i,t}+\theta^{\mathsf T}X_{i,t}+\varepsilon_{i,t} \]\(\alpha_i\) 是行业固定效应,\(\gamma_t\) 是周固定效应;\(X\) 控制既有波动率、20日收益、过去回撤和广度。标准误按行业与周双向聚类。
| 检验 | 结果 | 解释 |
| 简单秩相关 | ρ = 0.051 | 方向正确,排序能力弱 |
| 行业+时间固定效应 | β = 0.066 t = 7.50 | 同一周、不同行业之间仍有信息 |
| 加入控制变量 | β = 0.043 t = 5.28 | 不是波动率/动量的完全替身 |
| Fama–MacBeth | β̄ = 0.120 NW t = 7.97 | 538周截面回归平均方向稳定 |
| 15%尾部事件 | 5.40%→8.43% | 精确率提升1.56倍,但绝对精确率仍低 |
| 未来20日平均收益 | 1.40% vs 1.31% | 不预测负收益;高位后仍可能继续上涨 |
多期限响应
| 未来窗口 | 高脆弱区最大回撤 | 其余区域 | Spearman |
| 5日 | 2.76% | 2.05% | 0.050 |
| 10日 | 4.21% | 3.23% | 0.053 |
| 20日 | 6.11% | 4.92% | 0.051 |
| 60日 | 9.72% | 8.78% | 0.031 |
经济含义:信息主要集中在未来5—20日的路径风险,60日后衰减;这更像短中期流动性脆弱,而不是长期预期收益因子。
“先集中、再破裂”能不能预测收益?
这一次我们把网页上的两层逻辑单独拿出来检验:过去 60 日曾有 (Z\ge80),随后 Trigger 分别突破 25、50 和 70。信号按周取样,所有收益都从信号之后开始计算。
| 状态 | 样本数 | 未来5日收益 | 未来20日收益 | 未来20日最大回撤 | 20日亏损概率 |
| 全样本 | 68,592 | +0.32% | +1.32% | 5.01% | 46.65% |
| 拥挤、尚未破裂 | 13,494 | +0.32% | +1.67% | 5.17% | 45.40% |
| 拥挤后破裂 · T≥25 | 10,761 | +0.43% | +1.44% | 5.50% | 46.33% |
| 拥挤后强破裂 · T≥70 | 3,152 | +0.59% | +2.27% | 5.74% | 43.88% |
答案:能提示风险路径,不能提示负收益。破裂越强,之后的途中回撤越深;但平均收益没有转负,亏损概率也没有上升。原因并不神秘:Trigger 出现时价格已经跌过,后续样本同时包含继续下杀和超跌反弹。它适合做“执行确认”,却不能单独成为做空因子。
日频复核:方向更清楚,统计口径更严格
日频留下 326,208 个有效行业日观测。由于未来 20 日窗口天然重叠,下面的日频数字是描述性证据,不把每一天当成完全独立样本;对于“集中后破裂”,再按行业设置 20 个交易日冷却期,只保留非重叠的首次触发。
| 日频检验 | 高位/触发组 | 对照组 | 含义 |
| V≥80 的未来20日最大回撤 | 6.33% | 5.02% | 与周频 6.11% vs 4.92% 同方向 |
| V 与未来20日最大回撤秩相关 | ρ=0.059 | — | 周频为 0.051 |
| 最高20%消融:只用 P | ρ=0.088 | — | 仍是最强单项 |
| 最高20%消融:√(P×M) | ρ=0.076 | — | 仍优于三项几何平均 ρ=0.057 |
| 非重叠日频首次触发 | 样本数 | 未来20日收益 | 未来20日最大回撤 | 负收益比例 |
| 全体日频基准 | 326,208 | +1.21% | 5.12% | 47.27% |
| 拥挤后 T≥25 | 5,060 | +1.38% | 5.58% | 46.19% |
| 拥挤后 T≥50 | 4,534 | +1.19% | 5.77% | 47.24% |
| 拥挤后 T≥70 | 3,526 | +1.58% | 6.01% | 46.63% |
日频没有改变判决,只让边界更清楚。日频确认了危险区的左尾信息;但把信号去重后,“集中后破裂”仍主要意味着后续波动和途中回撤增加,不能稳定地预测 20 日后为负。连续几天的原始信号看起来更强,部分只是同一事件被重复计数。
五、消融实验:公式为什么这样写,它是不是最优?
为了公平比较,不再给每个公式使用不同阈值,而是统一取各自最高的 20% 样本。这样测到的是排序能力,不是“谁发出的信号更少”。
| 公式或消融版本 | Spearman ρ | 最高20%未来回撤 | 其余样本 | 读法 |
| 只用成交参与 (P) | 0.083 | 5.78% | 4.80% | 最强单项 |
| 只用龙头裂口 (G) | 0.002 | 5.16% | 4.95% | 单独几乎无预测力 |
| 只用相对强势 (M) | 0.029 | 5.60% | 4.84% | 弱但方向正确 |
| 去掉 (P):\(\sqrt{GM}\) | 0.013 | 5.37% | 4.90% | 明显退化 |
| 去掉 (G):\(\sqrt{PM}\) | 0.069 | 5.89% | 4.77% | 预测型复合分最佳 |
| 去掉 (M):\(\sqrt{PG}\) | 0.051 | 5.47% | 4.88% | 与现行公式接近 |
| 算术平均 ((P+G+M)/3) | 0.053 | 5.65% | 4.83% | 略优于现行几何平均 |
| 最小值门控 (\min(P,G,M)) | 0.043 | 5.55% | 4.86% | 约束过严 |
| 现行几何平均 ((PGM)^{1/3}) | 0.050 | 5.60% | 4.84% | 结构解释优先,不是预测冠军 |
为什么页面仍保留三项几何平均?因为它回答的是一个更窄的问题:“成交聚集、龙头主导、相对强势是否同时存在?”几何平均能阻止单个极端分数包办总分。但如果目标改成纯粹预测未来 20 日回撤,消融支持更简单的 \(\sqrt{PM}\),甚至成交参与度单项。后续页面应把前者标成结构脆弱度,把后者作为独立的预测排序参考,不能混称同一个最优 KHI。
稳健性:不是半导体一个案例撑出来的
剔除半导体后,现行 (V) 与未来 20 日最大回撤的秩相关仍为 0.052;再剔除半导体、电子、光伏、电池、计算机和通信簇后仍为 0.053。把信号前后平移 26 或 52 周,相关落到 −0.021 至 0.008,安慰剂没有复制主结果。年度方向在 2016—2025 多数年份为正,2020 接近零,2026 为 −0.033:它有平均意义上的信息,但并非每年都能排序。当前公式又受 2026 半导体案例启发,因此真正的实时样本外只能从 2026 年 8 月冻结公式后开始。
六、能不能指导仓位?费后一票否决机械策略
我们预先设定一个简单覆盖层:升温降至 90%,拥挤降至 75%,高位松动降至 50%,破裂确认降至 25%。信号滞后一日,未投资部分持有现金,每次权重变化计 10bp 成本。
| 2016—2026 | CAGR | Sharpe | 最大回撤 | 最差5%日均 |
| 行业等权基线 | 12.45% | 0.627 | −41.23% | −3.70% |
| 机械风险覆盖层(费后) | 9.22% | 0.567 | −36.78% | −3.00% |
机械策略不通过。它把CVaR改善约19%、最大回撤改善约11%,但平均仓位只有83.4%,年换手11.5倍,CAGR少3.23个百分点、Sharpe也下降。2023—2024回撤改善较明显,2025—2026却牺牲约5.8个百分点CAGR。高脆弱状态会持续且Trigger会跳动,直接映射仓位既损失上涨、又制造交易成本。
可以指导停止追高、限制新增行业风险、提高审查频率。
条件使用作为已有策略的风险上限,必须在该策略自身重新回测。
不能指导看到80分就清仓、自动做空、把Trigger每次跳动都交易。
七、KHI 最终职责表
| 表针 | 射程 | 能否提前 | 典型事件 |
| 吸收比率 / 系统KHI | 共同因子耦合、分散失效 | 弱提前 + 同期确认 | 2015、2024 |
| 大小盘割裂 | 资金从小盘抽离 | 需要单独验证 | 2024微盘 |
| 行业脆弱度 V | 局部主题/行业拥挤 | 能识别危险区域 | 2021、2026 |
| Trigger T | 价格与广度已经破裂 | 不能称预测 | 所有事故的执行确认 |
| 原风格KHI / 原抱团KHI | 研究性描述 | 历史预测未通过 | 页面保留、策略降级 |
八、数据纪律与仍未解决的问题
· 行业成员按历史进入/退出日期动态恢复,不拿今天成分回看过去。
· 2015—2023市值/换手大体日频,近期主要周频;市值仅向前填,成交参与只在真实快照计算后有限延续。
· 当前没有机构共同持仓和days-to-liquidate授权数据,因此V是价格/成交/内部结构代理,不是严格持仓拥挤度。
· 周度观测的未来20日目标重叠;双向聚类和Fama–MacBeth Newey–West已缓解,但不能制造独立样本。
· 所有消融都统一取最高20%信号覆盖率;现行三项几何平均没有赢得预测竞赛,不能事后改口称“最优”。
· 2015没有足够预热历史;2026参与了公式形成,都不应被包装成干净OOS。
· 下一步最有价值的不是继续堆总分,而是保存每日vintage、等待真正实时OOS,并单独研究大小盘割裂对2024型事故的预测力。
最终结论
命题只成立一半。“先集中”能够识别未来 5—20 日左尾更厚的危险区域;“再破裂”会让后续路径回撤进一步增大,却仍然不能预测负收益。公式消融也说明:三项几何平均适合表达结构同时恶化,但预测排序不如成交参与度单项或 \(\sqrt{PM}\)。因此最诚实的产品设计是把结构诊断、预测排序、破裂确认分开显示。它们共同服务于风险预算和停止追高,而不是被压成一个万能卖出分数。