本卷目录上册·截面

完成正文

截面(一)·因子|同一时刻,如何把强弱放在一张桌上

山中木匠选梁,不会把一根新伐的湿木与一根晾了三年的旧木直接比重量。湿木沉,未必更坚;旧木轻,也未必更弱。他先看树种、长度、含水与用途,再把可比的木料并排放上架。比较若没有共同条件,结论只是两件不同事物碰巧留下的数字。

截面因子的第一条纪律,也不是算得复杂,而是先确认谁能坐到同一张桌上。候选范围、观察时点、数据发布日期、交易状态与行业属性,必须在计算以前写清。样本边界不稳,后面的标准化、加权和排序只会把混乱装进更精致的盒子。

所谓同一时刻,不只是把收盘日期写成同一天。价格可以截至今日,财务数据却只能使用今日已经公开的那一期;题材热度也只能取当时真实可见的信息,不能把后来形成的共识倒灌回去。截面是站在当下回望,不是站在未来替过去补全答案。

候选池先设最低可比条件。长期停牌、价格失真、成交极薄、数据严重缺失或处在无法正常交易状态的标的,应当单独标记或暂不排序。排除不是断言它们没有价值,而是承认当前数字无法与正常样本公平比较。不能称量的木料,先离开秤盘,不必硬算一个名次。

因子来自问题,不来自指标仓库。若问题是“此刻谁更强”,价格强度要回答相对表现,量价因子要回答这种表现是否得到真实交换支持,趋势因子要回答力量是否持续,热度与非共识要回答强势是否已经过度拥挤,兑现力则回答价格背后有没有经营承接。

每个因子都应写成一句朴素的话。比如价格强度不是“过去涨幅越大越好”,而是“在相同观察窗口和背景下,谁获得了更持续的价格承认”;成交额不是“越大越好”,而是“当前交换能否承载关注与参与”;兑现力也不是“利润增速越高越好”,而是“承诺是否按原先路径落到可核对结果”。

这句话决定计算方向,也决定何时不能使用。若一个指标无法说明它代理什么判断,只因常见便被放进模型,它就像药柜里没有标签的粉末:看似增加配方,实际增加未知。因子数量不是严谨的证明,少而清楚,常胜过多而互相重复。

观察窗口要与问题相称。过短,只见一日情绪;过长,又把已经衰退的旧强势留在分数里。可以同时保留近、中两个窗口:近窗看当下承认,中窗看背景基础,再要求二者不能完全背离。窗口不是越多越好,每增加一个,都要说明它提供了哪一种不同信息。

同一事实也不能换名字重复投票。近几日涨幅、突破幅度、均线距离与趋势斜率,常含有大量相同价格信息;成交额、成交额增幅和量比也可能共同奖励一次放量。若把高度相关的指标全部相加,表面是多因子互证,实际是同一个声音占了多张选票。

真正的互证,来自不同来源的证据。价格说参与者愿意抬高交换水平,成交与换手说这种抬高发生在足够真实的交换中,财务兑现说市场想象之外有经营事实,非共识差则说明好处是否已被所有人提前写入。它们可以一致,也可以冲突,而冲突本身就是需要主观复核的信息。

原始数字还不能直接同桌。成交额以亿元计,换手以百分比计,利润增速可以极端跳跃,价格强度又可能分布狭窄。直接相加没有意义。需要把每项数据转换成共同的相对位置,例如在有效样本中的分位,或经过稳健处理后的标准分,使“处在样本前列”成为共同语言。

分位数朴素而有用。它不执着于第一名比第二名究竟多出多少,只关心彼此所处位置,能减弱极端值对总分的绑架。但分位也会丢失距离:第一与第二可能相差很远,也可能几乎相同。因此榜单最好同时保留原值、分位与数据质量标记,不能只给一个脱离来处的得分。

标准分保留距离,却容易受极端样本影响。少数异常增长、异常换手会拉动均值与波动,使正常标的被压缩在狭小区间。对厚尾数据,应先截尾或使用中位数、绝对偏差等稳健尺度。处理极端值不是掩盖事实,而是不让一处异常决定所有人的相对位置;原始异常仍应单独展示,供人追查。

方向也要统一。价格强度高通常是加分,数据缺失、波动失序或拥挤过热可能是减分;有些因子则不是单调关系。换手太低意味着交易承载不足,过高又可能意味着躁动与分歧,合适区域反而在中间。若把所有指标都写成越大越好,现实会被方便的公式削平。

行业差异是同桌比较最隐蔽的偏斜。金融、消费、科技、资源的正常成交、利润波动与估值反应不同。先做行业内相对位置,可以看个体是否胜过同类;再保留全市场原始位置,可以看它是否具有跨行业竞争力。二者并列,比只做一种排序更诚实。

行业划分也会出错。业务跨界、产业链位置变化,都可能被旧分类放错。遇到这类标的,不宜为了计算整齐强行归属,而应记录主分类与备选分类,观察结论是否对分类敏感。一个名次若只在某种勉强归类下成立,强度就应打折。

规模校正同样要谨慎。大市值成交额高,小市值换手更活跃;不处理,榜单可能只是规模榜。可以在规模组比较。但中性化不是把规模影响全部抹掉,因为承载能力本就是交易价值的一部分。要去掉的是无关偏置,保留的是问题真正需要的容量信息。

缺失值不能默默填成平均。没有财务数据,可能因为披露节奏不同;没有正常成交,可能因为停牌;新上市标的缺少中期历史,也不是普通随机缺失。做法,是区分“暂未可得”“不适用”“质量可疑”,并决定哪些缺失允许以较低置信度参与,哪些直接失去入池资格。

若必须给总分,权重应先从判断重要性出发,再接受相关性与稳定性检查。价格、量价、趋势共同描述市场承认,可以形成一组;热度、非共识与兑现描述赔率质量,可以形成另一组。组内避免重复,组间保持平衡。权重不是对真理的宣告,只是把注意力如何分配写在明处。

本册不在这里展开权重训练、样本外检验和失效监控,那属于下册更完整的评分体系。截面篇只要求一件较基础的事:任何权重变化都能解释它改变了何种判断,任何结果都能拆回分项,不用一个神秘模型替代清楚理由。

因子之间可以设置必要条件,而不必一味相加。价格极强但成交承载不足,暂缓;热度极高而兑现空白,降级;财务不错但市场尚未承认,留在候选而非魁首。必要条件不是为了追求绝对安全,而是防止一个极端优点把结构性缺口遮住。

同时也要避免否决条件过多。若每一项都必须完美,榜单只会留下已经被所有证据共同确认、也可能早已失去赔率的标的。因子的作用是提高优先级,不是消灭不确定。允许某些短板存在,但要知道它属于尚待验证、可容忍差异,还是与核心问题直接冲突。

计算完成后,先不要急着看第一名。先看分布:分数是否集中,头部是否真正拉开,某个行业是否异常占据前列,单项极值是否主导总分,缺失处理是否改变梯队。若第一与第十几乎没有差别,精确名次没有意义;若头部断层明显,才值得进一步追问原因。

再做敏感性检查。轻微改变窗口、极端值处理或行业口径,前列名单是否大体稳定?稳定不意味着绝对正确,却说明结论不是由一颗松动的螺丝支撑。若名次稍改参数便剧烈翻转,不应挑选最合心意的一版,而应承认当前证据无法给出清楚高下。

异常项要回到原始事实。某标的价格强度突然居首,是持续推进还是一次事件跳空;成交额放大,是健康承接还是高位对倒;兑现力跃升,是主业改善还是低基数、处置收益。因子负责把异常举到眼前,人负责判断它究竟属于信号还是噪声。

这里也要防止研究者把主观意见偷偷塞进数据。为了让喜欢的标的上榜临时改窗口,为某家公司单独放宽缺失标准,为不喜欢的行业增加惩罚,都会使统一尺度失效。主观可以在榜后作否决或补充,却不该在榜内暗改尺子。规则若需更新,应对全部样本生效,并保留旧版本。

版本记录是比较秩序的一部分。数据日期、样本范围、因子定义、异常处理与权重,都应留档。这样一张榜单后来被证明失误时,才能分清是数据问题、规则问题,还是不可避免的新事实。没有版本的结果只剩结论,无法积累经验,也无法防止事后改写。

因子表最终至少要让人一眼看见五件事:原始证据、转换后的相对位置、综合分数、数据质量与需要复核的冲突。若表格只能显示名次,便会诱使使用者服从;若来路同时展开,名次才只是研究入口。

常见误用有三种。第一,把能取得的数据都当成有用因子;第二,把多个同源指标当成多重确认;第三,把总分当成事实本身。前两种制造虚假的丰富,后一种制造虚假的确定。因子体系真正追求的,是用最少的重复,让最多的关键差异显形。

木匠最后选梁,仍会听木纹、看结疤,也会考虑它将支撑屋脊还是门楣。称量与分组没有替代手艺,却阻止他把湿重误作坚实,把不同用途混成一场竞赛。市场中的同桌比较也是如此:先让条件公平,再让数字说出自己能说的部分。

当每个候选都接受同一时点、同一口径和同一反面检验,强弱才不再只是印象。因子没有替我们选出必胜者,它只是把偏爱、遗忘和喧哗推远一点,让真正值得追问的差异,安静地留在桌面上。