做风控,大家每天都在跟因素、规则、策略、事件这些术语打交道。其实剥开外衣,底层的逻辑非常清晰:因素是最小的单元,因素组成规则,相似的规则聚合成规则集,再拼装成反欺诈、授信等具体策略,最终汇总成贷前审批的完整事件。
那模型在这个体系里算什么呢?简单来说,模型本质上是一个高度浓缩的“超级因素”。比如常用的信用A卡,就是用历史数据通过算法算出一个0到1的逾期概率。它之所以特殊,是因为内部打包了成百上千个微小的规则,比单一维度的简单规则区分度更细腻。不过,无论模型在后台跑得多复杂,当它的预测概率或评分输出到决策引擎时,最终还是会回归为一个具体的因素,去参与策略运算。理清了这层关系,规则和模型怎么配合,自然就豁然开朗了。

模型分数算出来后,最头疼的就是怎么划定决策点,也就是Cutoff。假设跑出了一个拒绝模型,首先得看分数分布的单调性和KS值。如果分数从高分到低分,坏账率能完美单调递减,KS值也达标,说明模型区分度很好。接下来就是看业务指标。最简单的做法是直接盯坏账率,比如规定坏账率不能超过某个阈值,反推出对应的分数段和通过率。但现实中,很多公司会算得更精细,去测算每个阈值点带来的利润空间,用利润最大化来决定Cutoff。如果算出来的通过率达不到公司的KPI要求怎么办?这时候通常不会一刀切,而是把处于临界值的“灰度客户”挑出来,转入人工信审,或者交给其他辅助模型做二次回收。
这就涉及多模型的配合了。先说回收策略,核心是在风险可控的前提下提高通过率。对于那些被主模型判定为较差而拒绝的客户,我们可以引入不同的模型进行再评估。举个例子,假设有一批客户的申请分落在660到679之间,主模型觉得风险偏高。但如果引入芝麻信用分做交叉验证,发现其中芝麻分在680以上且申请额度在1万以内的客户,实际风险表现和680分以上的优质客户几乎一样。通过这种多维度的模型矩阵,我们就能精准地把这部分人“捞”回来。

除了捞回拒件,多模型补漏也是常规操作。现实情况是,没有任何一个模型的数据源能做到百分之百覆盖,数据缺失、查得率低是常态。既然不能因为查不到数据就直接拒件,就需要备用模型来打补丁。通常会准备几个备选模型,按数据覆盖率从高到低排列。客户在模型A里查不到数据,系统就自动降级去跑模型B,依次类推。数据源越丰富,能覆盖的客群就越广。
更重要的是,多模型组合能大幅提升整体风控的稳定性。日常工作中,我们不仅会用多模型做A/B测试,给新模型分配流量看效果,更看重的是它们组合后的抗风险能力。单个模型再优秀,也不敢把全量流量都交给它。因为数据源断供、接口失真或者预测能力突然衰减的情况在业内太常见了,一旦事发,事后补救往往为时已晚。相反,把几个表现不错的模型组合起来,利用它们在不同数据维度上的互补性,整体的数据表现会平滑、稳定得多。
最后,千万别忽略了模型日志。风控系统的每一次阈值调整、规则增删,都必须留下详尽的记录。风控数据的波动无非两个源头:外部客群质量变化,或者内部策略调整。当业务端反馈资产质量突然变差时,如果没有日志,排查起来就像大海捞针。但如果日志记录清晰,你一眼就能看出是不是昨天刚好调整了某个模型的Cutoff,或者某条规则被误关了。这就好比程序员写代码必须打Log,它是定位风控问题最直接、最有效的线索。
Войти сейчас