本卷目录下册·轮转

完成正文

轮转(六)·校验|因子标准化、权重、一票否决与失效监控如何接受回测

《夺魁算经》·轮转(六)·校验|因子标准化、权重、一票否决与失效监控如何接受回测

古人校准衡器,不先问哪只秤盘所指最合心意,而先验砝码、梁臂与刻度。春湿秋燥,木梁会弯;货色更换,旧砝码也可能失准。若只在称出好结果时相信它,秤便不再是量器,只是偏好的回声。

前篇把纸面魁首带到峡江,检查容量、冲击、拥挤与共同风险。至此,还须回头审问产生榜单的整架衡器:不同因子怎样放到可比尺度,权重凭什么相加,哪些破裂足以取消资格,以及一套曾经有效的秩序何时应被降级、停用。校验不是最后为榜单盖印,而是允许历史与新数据推翻它。

原始因子没有天然共同单位。涨幅、成交额、趋势斜率、热度与财务兑现,量纲、分布和更新频率各异;把原值直接相加,数值大的项目会因单位而取得权力。标准化所做的,不是把异质证据变成同一种事实,而是先把它们搬到可以比较的刻度。

截面标准化回答同一时点谁相对更高。均值与标准差保留距离,却容易被极端值牵动;中位数与绝对偏差更稳健,但会弱化尾部差异。分位或秩转换不怕厚尾,解释也直观,代价是丢失绝对间距:第一与第二相差一线,和相差一壑,可能得到近似名次。

时序标准化回答一个对象相对自身历史处在何处。它能识别成交、估值或趋势是否偏离常态,却依赖窗口与制度稳定;窗口太短易随噪声漂移,太长又把旧制度带进今日。截面强不等于自身异常强,时序异常也不等于同桌领先,两种刻度应并列,不能互相冒名。

稳健缩尾可限制异常值支配总分。截断会把阈外差别抹平,温莎化保留边界次序却仍改变尾部含义;若极端值本是危机或跃迁的有效信号,过度处理会把警报剪掉。因此必须同时保存原值、处理值与异常原因,缩尾界限只能是预先登记、待回测的参数。

行业中性化试图剥离行业共同水位,让公司在同业中比较;它能防止强行业成员占满全市场榜,却也可能消去本来就要研究的主线迁徙。市值、流动性等中性化亦有同样代价。较诚实的做法是保留原始榜、行业内榜与中性后残差榜,让分歧进入解释,而不是让一次回归替市场作最终裁决。

标准化还受样本池影响。新纳入一批极端对象,所有人的截面分位都会移动;行业成员过少,稳健统计也未必稳健。每次计算应记录有效样本、分组边界、估计窗口和规则版本。合理方法稍作变换,排序便彻底翻转,说明分辨率不足,不应以更多小数掩饰。

缺失值不能被一个方便的零填平。零可能表示中性,也可能表示真实为零;前向填充会让旧事实伪装成今日事实,横截面中位数填充则把“不知道”伪装成“普通”。应先区分尚未披露、数据源故障、不适用与异常缺失,再选择降置信度、保留缺失指示、有限期沿用或暂不精排。

与缺失相邻的是数据时钟。价格在收盘后可见,财报在正式披露后可用,行业分类、成分调整和舆情数据也各有到达时间。回测必须按当时真正可得的时间戳重建截面,不能把后来修订值、最终分类或完整日线提前放回过去。时钟未对齐,再精巧的标准化也只是把未来磨成今日的刻度。

因子变得可比之后,权重才有讨论资格。等权意味着在缺少更强证据时承认无知,简单、稳健,却默认各项信息量和噪声相近;专家权重把机制认识写入模型,便于解释,却可能把熟悉感固化;统计学习权重能利用历史关系,也最容易把偶然结构当成规律。

权重来源必须与用途匹配,并留下出处:来自经济逻辑、历史排序能力、风险约束,还是多目标折衷。任何数值都只是示意或待回测参数。不能先看全样本结果,再为最漂亮的一组权重补写理由;也不能因为模型复杂,就把估计误差藏在总分之后。

权重会漂移。趋势因子在单边期可能占优,兑现与承载在分歧期更重要;数据覆盖、市场制度和参与者结构也会改变有效关系。动态权重可以响应变化,却增加估计噪声和换手;固定权重更可审计,却可能迟钝。无论选哪一种,都要设更新频率、最小样本、变化边界和回退版本,并在样本外比较。

冗余因子会制造虚假多数。价格强度、趋势斜率与某些热度指标可能只是同一行情的多面镜,三项同向不等于三份独立证据。共线性还会使统计权重符号与大小不稳定。应查看相关、条件数、聚类或正则化结果,更要追问共同因果;可合并、降权或只保留代表项,同时检验删去一项后结论是否仍在。

一票否决与权重不是同一种语言。权重表达证据之间的相对贡献,一票否决只处理资格已经破裂:数据不可比、关键字段确认错误、基础流动性消失、合规边界触发,或模型明确规定的适用域不再成立。此时总分再高,也没有继续精排的共同基础。

否决不得用来表达偏好。嫌估值高、涨幅大、题材陌生,若只是研究者不喜欢,应成为可讨论的风险项或分项,不应绕过权重直接删名。每条否决都须事前定义、证据可核、触发时间可追、解除条件明确;紧急触发后还要复核。否则“一票”会成为人工改榜的暗门。

这架衡器最终必须交给回测,但回测不是把全部历史交给机器寻找最优答案。训练集用来形成因子、标准化与参数;验证集用于比较有限方案和决定停止;样本外只检验冻结后的规则。若反复查看样本外再修改,它便已成为新的训练集,所谓外部证据随之消失。

时间有序的数据不能随意打乱。滚动检验用固定长度窗口持续向前,能看见关系随制度变化;扩展窗口保留更多历史,估计更稳却可能拖着旧结构。走前检验在每个时点只用此前信息训练,再评价下一段,最接近真实研究流程。窗口长度、更新节奏与间隔都须预先说明并接受敏感性检验。

数据泄漏往往藏在细节里:用全样本均值做标准化,用未来成分决定过去股票池,用最终修订财报训练当期模型,或让标签区间与特征区间重叠。预处理、缺失填充、行业中性和权重估计,都必须在每个训练窗内独立拟合,再应用到后续数据。

幸存者偏差会让退市、停牌和曾经失败的对象从历史中消失;未来函数会让尚不可得的信息提前出现。还要防止选择偏差:试过大量因子、窗口与阈值,却只报告赢家。保留全量试验登记、真实历史成分、发布时钟和被否决样本,远比再添一条漂亮曲线重要。

过拟合不只来自复杂模型。简单规则若经历足够多次人工挑选,同样会贴合噪声。应限制自由度,比较合理参数邻域,使用替代样本与负向检验,并记录方案总数。最优点若孤悬陡峰,通常不如一片略低但平稳的平台可信。

评价也不能只看收益。既然算经回答“谁更值得优先研究”,就要检查排序稳定、梯队保持、前列命中、状态撤回与发现延迟;再看回撤、换手、冲击和成本后表现。收益高而排序频繁翻转、成本吞没、尾部回撤失控,不能称为合格的研究次序。

还要检验迁移能力:由一段时期到另一段时期,由大样本到小样本,由某行业到其他行业,结论是否保留方向与分辨率。迁移失败不必强求统一模型,可改为制度分层或限定适用域;若新增数据持续否定原关系,则应允许撤回,而不是用新解释守住旧成绩。

参数敏感性要围绕合理邻域,而非只展示精选值。标准化窗口、缩尾边界、权重、确认期、成本和否决条件稍作变化时,前列梯队、撤回率与成本后结果怎样变化?还应按趋势与震荡、高低波动、流动宽窄、披露密集与稀疏等制度分层,并施加极端缺失、价差扩大、相关性收紧和样本骤减的压力测试。

压力测试不是预言某日情景,而是问规则靠哪些安静假设活着。若轻微扰动便全盘改名,应降低置信度或收窄用途;若只在某种制度成立,就明确标注适用域。分层也不能事后切到结果最好,制度定义、切换信号和样本下限都应先定,再走前检验。

回测通过并非永久通行。线上应持续监控输入分布、缺失率、数据延迟、因子相关、标准化参数、权重变化、排名翻转、命中、撤回、成本代理与实际可实施偏差。监控基线来自冻结版本及其适用制度,报警线同样只是待回测、可审计的工程参数。

漂移可分为数据漂移、关系漂移和结果漂移。输入分布改变,未必立刻证明预测关系失效;排序能力下降,也未必来自数据故障。报警应给出来源、持续时间与影响范围,避免一个红灯把所有问题混成“模型坏了”。短暂越线可观察,多项指标共振或资格破裂则提高处置等级。

处置顺序应预先写好:先降置信度和研究优先级,再视情况切换到更简单的基线版本、缩小适用范围,必要时停用;随后冻结现场、复核数据与机制,决定恢复、改版或撤回。降级不是失败遮掩,停用也不是永久判决,而是拒绝让已失去证据的模型继续借旧回测发言。

每次模型版本都应保存代码或规则、数据快照、特征定义、参数、训练验证区间、成本假设、否决清单、审批与上线日期。输入、分数、状态转移、人工覆盖和报警处置均要留审计链。新旧版本并行一段可比期,才能分清市场变化、数据变化与规则变化。

人的终判仍在最后,但边界必须清楚。人可以因未编码的新事实暂缓采信、要求补证或触发既定资格复核,不能偷偷改权重、删掉不喜欢的样本,再把结果归功于模型。机器负责一致计算和暴露异常,人负责解释适用域、承担例外理由,并接受日后复盘。

至此,上册的截面与下册的轮转才闭合:同一张桌上的证据先被校成可比尺度,连续截面再记录力量迁移;换魁经过缓冲、成本与容量,最后由样本外、压力情景和线上失效监控审判。任何一环失真,都应回到对应环节修秤,而不是在榜尾补一句免责声明。

暮色里,校秤人收起砝码,却没有把最后一次平衡刻成天命。他留下梁臂的温湿、砝码版本、误差与复验日期,等下一季再校。榜单也应这样保存自己的可错性:能说明为何排序,也能说明何时不再相信排序。

数是证据秩序,不是神谕。《夺魁算经》从“此刻谁强”走到“力量怎样轮转”,最终仍只回答谁更值得优先研究,不直接回答某一笔具体交易。魁首不是被公式永远加冕的人,而是在当时可见、可比、可复核的证据中暂居前列,并随新证据到来,随时准备接受撤冠。