规则挖掘不止决策树:五族方法怎么选? 决策树是主力,但不是唯一。实战挖规则有五族方法,按场景选:树基类:单棵全树抽规则、序列覆盖、级联树——适合从数据自动找切割;评分卡 WOE 基:WOE 逻辑回归,把变量转 WOE 后做回归,得到可解释的评分卡——适合需要稳定分数的场景;专家修正类:专家硬规则 拒绝推断——适合强监管、必须有明确规则的领域;分群交互类:聚类分群、交互探测——适合某两类变量组合才坏的隐藏风险;黑箱提取类:RuleFit、SkopeRules、关联规则——从复杂模型里提取可读规则,兼顾区分度和可解释。树基类实战DecisionTreeClassifier 抽取规则下面用 sklearn 的 DecisionTreeClassifier 训练一棵浅树并导出可读规则。关键步骤切分数据、训练模型、用 export_text 输出规则。import pandas as pd from sklearn.tree import DecisionTreeClassifier, export_text from sklearn.model_selection import train_test_split 1. 构造示例数据两个特征目标为 0/1 df pd.DataFrame({ income: [3, 8, 5, 12, 6, 15, 4, 9], age: [25, 45, 30, 50, 28, 55, 22, 40], bad: [0, 1, 0, 1, 0, 1, 0, 1] }) X df[[income, age]] y df[bad] 2. 切分训练集和测试集 X_train, X_test, y_train, y_test train_test_split( X, y, test_size0.25, random_state42 ) 3. 训练浅树限制深度便于抽规则 clf DecisionTreeClassifier(max_depth2, random_state42) clf.fit(X_train, y_train) 4. 输出可读规则 print(export_text(clf, feature_names[income, age])) 输出示例 |--- income 6.50 | |--- class: 0 |--- income 6.50 | |--- age 47.50 | | |--- class: 1 | |--- age 47.50 | | |--- class: 1运行后可以看到模型自动找到 income 和 age 的切割点形成“收入低 → 好客户收入高且年龄适中 → 坏客户”的规则适合直接用于业务解释。评分卡 WOE 基实战scorecardpy 构建评分卡下面用 scorecardpy 完成变量分箱、WOE 转换和逻辑回归得到可解释的评分卡。关键步骤数据切分、变量筛选、分箱与 WOE、训练评分卡。import scorecardpy as sc import pandas as pd 1. 构造示例数据 df pd.DataFrame({ income: [3, 8, 5, 12, 6, 15, 4, 9, 7, 11], age: [25, 45, 30, 50, 28, 55, 22, 40, 35, 48], bad: [0, 1, 0, 1, 0, 1, 0, 1, 0, 1] }) 2. 切分训练集和测试集 train, test sc.split_df(df, bad, seed42) 3. 变量筛选这里直接指定可用变量 train train[[income, age, bad]] test test[[income, age, bad]] 4. 分箱并转换为 WOE bins sc.woebin(train, ybad) train_woe sc.woebin_ply(train, bins) test_woe sc.woebin_ply(test, bins) 5. 训练评分卡 card sc.scorecard(bins, train, ybad) score sc.scorecard_ply(train, card) print(score.head()) 输出示例每行给出一个综合评分分数越高代表风险越低运行后可以看到每个变量先被自动分箱再映射为 WOE 值最后通过逻辑回归得到每个分箱的分数。最终输出是一张可直接落地的评分卡适合需要稳定分数和强解释性的场景。怎么选?基本原则:能解释优先用树基/评分卡;强合规用专家硬规则兜底;怀疑有交叉风险用分群交互;已有复杂模型想提取规则用黑箱提取。一张速查表:追求快和可解释 → 树基;追求稳定分数 → WOE 评分卡;监管要求硬规则 → 专家修正;隐藏交叉 → 分群交互;复杂模型复用 → 黑箱提取。

相关新闻

最新新闻

Grok4.5是什么?怎么选、和其他大模型有什么区别:一篇讲清定位与适用场景

Grok4.5是什么?怎么选、和其他大模型有什么区别:一篇讲清定位与适用场景

对刚开始关注大模型的开发者来说,最近经常会看到 Grok4.5 这个名字。很多人第一反应是:它到底值不值得试?适合写代码、做问答,还是只是一波热度?如果你平时也会在 AI模型聚合平台 neneai.cn 这类工具站上对比不同模型&…

2026/8/26 17:26:37
C++进阶知识5.0

C++进阶知识5.0

目录 伪唤醒与竞态条件 ☆☆☆TLS技术(内存池一级缓冲区的使用) 常用的输入接口 防火墙(多机器协作) 伪唤醒与竞态条件 我: 请解释一下你实现的线程池中,HandlerTask 函数内部为什么使用 while 循环来检查任务队列是否为空&a…

2026/8/26 17:26:37
多模型对比写同一个函数:Gemini、GPT、DeepSeek 谁更靠谱?开发者横向实测

多模型对比写同一个函数:Gemini、GPT、DeepSeek 谁更靠谱?开发者横向实测

Q:同一个函数分别交给 Gemini、GPT、DeepSeek 来写,哪个更靠谱? A:如果只看“能不能快速给出一版可运行代码”,三者都能完成基础任务;但如果放到真实开发里,差别就出来了。我最近拿同一个函数做…

2026/8/26 17:26:37
ArcGIS JS 基础教程(29):CSVLayer 表格点位图层

ArcGIS JS 基础教程(29):CSVLayer 表格点位图层

ArcGIS JS 基础教程(29):CSVLayer 表格点位图层零、写在前面一、功能介绍二、功能实现2.1 创建并配置(3D)2.2 让点位「浮」起来(高程模式)2.3 自定义字段类型(numericFields 等&…

2026/8/26 17:26:37
Java 第k个最小元素(K’th Smallest Element)

Java 第k个最小元素(K’th Smallest Element)

目录 【朴素方法】使用排序——时间复杂度为 O(n log(n)),空间复杂度为 O(1) 【预期方法】使用最大堆 - 时间复杂度为 O(n * log(k)),空间复杂度为 O(k) 【替代方案 1】使用快速选择 【替代方案 2】使用计数排序 如果您喜欢此文章,请收藏…

2026/8/26 17:26:37
Kafka + 人大金仓流式处理“的极度详尽、满载干货的技术

Kafka + 人大金仓流式处理“的极度详尽、满载干货的技术

一、为什么"Kafka 国产库"总是"一上线就翻车"? 先搞懂死因,才能对症下药。信创消息消费翻车,通常是消费模式、写入方式、事务控制三端集体拉胯。 1.1 单条插入(Single Insert)是"万恶之源&q…

2026/8/26 17:21:37