风控日报 — 2026-08-29
📊 原料:48 条相关条目(GitHub 仓库搜索 50 条原始 / arXiv 36 条原始中 10 条进入原料全部无关——新批次
2608.274xx(08-27 提交日期):ACT DR6 CMB 各向异性筛选与双折射、MCR-Bench 多轮代码评审基准、ML 工件安全扫描器覆盖与失败恢复评估、量子计算机规范理论谱指纹、CritICL 小模型失败模式弱到强泛化、随机酉线路局部量子信息动力学、Tacet 统计有效性记账语言、AGT 猜想证明、自由 Novikov-Zinbiel 代数、Lotka-Volterra 竞争扩散系统传播速度——两三项评估/扫描主题但域为软件安全与统计方法论,非交易风控)。arXiv 全噪声小计:连续 34 期(07-17→08-29)全噪声,累计 768 条中 1 条相关,噪声率 99.9%。剔除构成:~21 条已覆盖/重复(agentic-payment-risk-governor[08-27★★★]、ElliGAT[08-28★★]、RecoverAI[08-25★★]、lucidfence、phaas-tracker、TemporalStore、FFraud-com×2、api-evangelist 厂商档案 stub×6[complyadvantage/bics-network/appdome/cloud-custodian/complybridge/cortera+coris+checkout-com]、portfolio-risk、finpulse[08-25 已因体量不匹配剔除]、perishable-inventory、FPGA 交易系统[市场侧]、fftcg/Domino 游戏规则引擎×2、gnn-ieee-fraud-detection[08-27 过薄]、sushilpatil51p 学期项目[08-28 过薄]、justcheckingmate、obligation-net-optimizer)+ 4 个已确认恶意仓库残留不重复验证(hgthangbq-lang/defi-risk-screening[07-26]、Amy7007/VPN-Detector[07-26]、primatewakeisland574/payment-channel-guide[08-09]、yoelpa6680/upi-fraud-gnn[07-26])。连续 5 日无新确认恶意仓库,累计维持 20 个。今日筛出 6 条新增高信号条目(周五低谷日:昨日 9 条高产批次次日残留为主,不以弱条目凑数——runbook 允许低谷日 6-7 条)。今日主题是"监控与审计的自我怀疑":同一位作者(aghasalim)两仓连续把"评估即证据链"弧线推进到监控层与合规层——漂移监控的信号可能指错方向(PSI×AUC 退化相关性 −0.71)且对 label shift 结构性致盲,公平性审计发现 EU AI Act 明文豁免欺诈检测但豁免不等于无害(FN 差距比 FP 大一个数量级);加上 CMS 医疗欺诈的 LEIE 弱标签构造,"标签怎么来的"成为三个样本的共同问题。
今日高信号
1. mlops-fraud-pipeline (aghasalim) — 对"健康基线"校准的漂移监控自我审计(8 个 held-out 窗口上 PSI 与 AUC 退化的相关性为 −0.71——信号指错方向;label shift 控制组证明特征监控结构性不可见;100% null 列让 KS 报"健康"(PSI=0);40 特征裸 KS 健康数据每批误报 3.35 个、PSI 效应量门归零;CI 门禁阻断于模型检查而非指标阈值)【信号:★★★】
aghasalim/mlops-fraud-pipeline(2★, Python 3.12, 08-14 建→08-28 推送, 15 commits, 2.7MB, MIT)是 IEEE-CIS 欺诈模型(作者自己的 ieee-fraud-ml)的生产化:FastAPI 服务+CI 门禁+漂移监控。真正的交付物是 INCIDENT.md——"没人故意弄坏过的监控面板只是装饰性图表",作者注入三种失败场景并报告监控抓住了什么、漏了什么。四个发现层层递进:(1) 监控器的三个自身 bug 全部靠测试而非读代码发现——最严重的:模拟身份 provider 宕机(所有 id_* 列 100% null)时监控报"健康",因为 KS 检验丢弃非有限值,全 null 列没有可比内容 PSI 归零——"生产中最显眼的失败产生了比正常流量更干净的报告";(2) 漂移信号与真实退化负相关——8 个 held-out 窗口上 PSI×AUC 退化相关性约 −0.71:退化最大的窗口 PSI 几乎最低,PSI 最高的窗口退化最小,"接 pager 前值得先知道";(3) label shift 是特征监控的结构性盲区——纯标签漂移控制组(改变哪些交易是欺诈、不动任何输入分布)不被标记,且没有任何阈值设置能修复——监控特征的系统对"欺诈主体变了"原理上看不见;(4) 误报控制来自效应量门而非多重比较校正——40 特征/批=40 次犯错机会,裸 KS 在健康数据上每批标记 3.35 个特征;PSI 效应量门打开后健康批次标记 0.0(BH/Bonferroni 也是 0.0,无事可做)。CI 部署门禁阻断于模型检查而非指标阈值;基线 profile 不入库(IEEE-CIS 竞赛数据不可再分发,从自己的原始 csv 重建)。
风控视角:"评估即证据链"弧线(08-26 预注册→08-27 conformal 代价→08-28 对抗逃逸)推进到监控层的最诚实一环:上周的结论是"干净数据准确率≠部署准确率",今天是"监控信号本身也要被评估"——漂移分数与实际模型退化的相关性必须先测再接线,负相关的监控接上 pager 比没有监控更糟(团队会对真退化麻木)。label shift 结构性盲区直接对应国内场景:欺诈团伙轮换(赌博→杀猪盘→虚拟货币)不改特征分布只改标签语义,特征监控原理上抓不住,需要"标签代理信号"(事后回溯标签/人工抽检率)补位。"全 null 列 PSI=0"是所有用 PSI/KS 的特征平台都该跑一遍的测试用例。⚠️ 单人学生项目、IEEE-CIS 单数据集、−0.71 相关性是本数据上的观察非普适结论。与 风控模型 的漂移监控和 特征平台 的特征质量监控直接相关。→ GitHub
2. ai-act-fairness-audit (aghasalim) — EU AI Act 对欺诈检测的明文豁免与豁免之外的伤害实测(Annex III 5(b) 豁免原文:"用于检测金融欺诈的 AI 系统除外"——审计在法律上从未被要求;442,905 笔/1% 审查预算下的运营阈值审计:最差 segment 选择率 0.0012=四分之三阈值的 1/661;FN 差距比 FP 差距大一个数量级且 FN 才是客户体验的伤害;不可能三角在真实模型上实例化:等选择率/等 FPR/单一全局阈值三策略各自满足自己破坏另两个)【信号:★★★】
aghasalim/ai-act-fairness-audit(2★, Python 3.12, 08-14 建→08-28 推送, 11 commits, MIT)是同作者 LightGBM 欺诈模型对 Regulation (EU) 2024/1689 正文的公平性自审计(法条语料来自自己的 eu-ai-act-rag 仓)。方法纪律前置:预测用诚实预测(chronological folds+30 天 embargo+fold-local 编码——"审计漏数据的 split 测的是泄露"),阈值固定在 1% 审查预算——"阈值是运营阈值而非为审计好看选的"。三个层次的结果:(1) 前提被法规原文推翻——作者起初确信欺诈评分是教科书式 Annex III 高风险系统,读原文发现 5(b) 覆盖信用评分但"用于检测金融欺诈目的的 AI 系统除外":欺诈检测被明文豁免,Article 10 偏见审查义务不约束它,"这次审计在法律上从未被要求";(2) 豁免≠无害的实测——一个在不同产品线以 793 倍不同速率拦截合法客户、在 82% 无身份数据交易中只抓到 1.4% 欺诈的模型,从监管高风险网中完整穿过;(3) 错误率视角比选择率视角更有信息量——7/7 segment 低于 four-fifths disparate impact 阈值(最差 0.0012),但更有用的发现是 FN 差距在所有 segment 上比 FP 差距大一个数量级——"客户体验到的是漏过的欺诈"(FP 是摩擦,FN 是资损);(4) 不可能性的实例化而非引用——等选择率/等 FPR/单一全局阈值三个策略各自满足自己破坏另两个(基率不同所致),"选择哪个是谁承担哪种错误的决定,调参消不掉"。作者同时声明局限:可用 segment 无一是法定保护特征(卡类型/设备类型至多是代理),"演示了机制而非解除义务"。
风控视角:合规层的三重可迁移结论:(1) EU AI Act 对欺诈检测的明文豁免(反欺诈有显然理由——向被检测者解释检测会击败检测)是国内出海金融科技合规设计的必背条款,但豁免不等于模型无害——793×的拦截速率差与 FN 差距一个数量级的实测是"监管盲区里的自我治理"模板;(2) FN vs FP 差距的分层报告直接对应国内"客户投诉(FP 摩擦)vs 资损(FN 漏放)"的双维度平衡表,比单一 disparate impact 比率更贴近运营;(3) "审计漏数据的 split 测的是泄露"与 1% 预算运营阈值呼应上周 tune/calibration 分离——评估条件必须与部署条件一致。与 风控模型 的公平性与可解释性、风控策略 的合规设计直接相关。→ GitHub
3. cms-open-payments-fraud (adof96) — 医疗支付欺诈的 LEIE 弱标签构造与有监督/无监督对照(无标注公开数据 × 官方排除名单交叉 = 弱标签:Open Payments 药企/器械商→医生支付流为特征源,LEIE 联邦排除名单按 NPI/排除日期交叉出 is_excluded 目标列;强不平衡下显式声明优先 precision/recall/PR-AUC 而非 accuracy;supervised vs 无监督异常检测对照——标签只在事后验证异常与真实排除的重合度)【信号:★★】
adof96/cms-open-payments-fraud(0★, Python, 08-28 建→08-28 推送, 2 commits, 西语项目)解决"公开数据没有欺诈标签"的经典困境:CMS Open Payments(药企与器械制造商向医生/医院的支付披露,金额/支付类型/支付方/专科特征)本身无标注,用 LEIE(List of Excluded Individuals/Entities,因欺诈被联邦医疗计划排除的 provider 名单)按姓名/NPI+排除日期交叉构造 is_excluded 目标列,实现于 src/data/clean_data.py 的 label_fraud。对照设计:有监督建模用交叉标签训练;无监督异常检测训练不用标签,标签只在事后验证检测出的异常与真实排除案例的重合度。工程约定认真:src/ 按职责分层(data/features/models/inference/visualization)、notebooks 只做探索逻辑必须迁入 src、tests 镜像 src 结构一模块一测试、Streamlit app 只 import 不复写。CLAUDE.md 显式提醒"交叉排除名单的标签强不平衡——优先 precision/recall/PR-AUC 而非 accuracy"。
风控视角:"标签怎么来的"的第三种答案:昨日 lurescope 是基准标注、今日 LEIE 交叉是监管处罚名单反哺监督信号——国内对应物是"裁判文书网/行政处罚/失信被执行人名单 × 交易流水"的交叉构造,这是无标注场景下最常见的弱标签路径。无监督事后用真标签验证的对照设计也值得抄:异常检测在生产上常被当作无标签可用,但任何事后回溯标签都应反哺验证无监督方法的有效性。⚠️ 2 commits 新仓、docs/notebooks 还是 .gitkeep 空目录、无 README(CLAUDE.md 代行)、LEIE 标签的时效偏差(排除日期前的交易才算正样本)未见处理。与 反欺诈体系 的外部数据源与 风控数据架构 的标签工程相关。→ GitHub
4. federated-gnn-fraud-detection (Pranavthatenough) — 联邦图学习欺诈检测的最小诚实框架(FedAvg 跨"银行"时序切片聚合 GCN/GraphSAGE;可选 DP clip/noise 且明示"DP 通常进一步降低联邦性能——已知的真实 FL 挑战";GNNExplainer 逐笔解释呼应监管可审计要求;Future Work 诚实列出成员推理攻击模拟——"经验性测试隐私保证而非只是主张")【信号:★】
Pranavthatenough/federated-gnn-fraud-detection(0★, Python, 08-28 建→08-28 推送, 1 commit)模拟多家银行联邦训练共享 GNN 欺诈检测器——只共享模型权重永不共享原始数据(FedAvg),Elliptic 比特币数据集格式(合成生成器复现同样文件格式可端到端跑)。README 的诚实块:(1) DP 是可选项且明示代价;(2) 静态数据集无流式摄入;(3) Future Work 列出成员推理攻击模拟"经验性测试隐私保证而非只是主张"、正式 DP 会计(Opacus)、安全聚合(SMPC)、Flower 真多进程联邦、异构图扩展。
风控视角:与 08-24 mulenet(联邦 vs 中心化合并的量化答案:中心化反而掉点)同主题但更简单的样本——mulenct 的价值在"为什么不合库"的实验设计,本仓价值在把"共享权重不共享数据"的联邦骨架+DP 选项+解释器做成最小可跑框架,适合作为给非技术干系人演示跨机构联防概念的起点。成员推理攻击自测列入 roadmap 而非冒充已有,与本周诚实申报文化一致。⚠️ 1 commit、合成数据、按时间切片模拟银行间划分(非真实机构边界)。与 图风控 的跨机构联防相关。→ GitHub
5. end-to-end-aml-pipeline (robertpid) — 西语 AML 合成数据生成器的 typology 命名法(四种洗钱 typology 直接编码为 actor 继承类:ClienteNormal 白噪声掩护/PitufoBancario 连续现金 structuring/LavadorPlataformas 多微支付聚合+低于 1 万美元阈值系统性提现/LavadorCrypto 分散源→中心桥钱包→定额分批进交易所;15% 脏数据注入器(日期格式混乱/货币错字/PK null/重复行))【信号:★】
robertpid/end-to-end-aml-pipeline(0★, Python, 08-25 建→08-28 推送, 9 commits, 16KB, 西语)是 AML 数据工程管线的 Bronze 层:合成生成器用 OOP 继承(PerfilFinanciero 基类)把四种 typology 实现为行为 actor——其中 LavadorCrypto 的"分散源→桥钱包→定额分批进 Exchange" 是链上混币的离线简化版,LavadorPlataformas 的"多微支付+低于报告阈值提现" 直接对应平台骡子模式。星型模型(Dim_Cliente+Fact_Transacciones)+ 15% NumPy 向量化脏数据注入 + SQLAlchemy 上传 Azure SQL。
风控视角:"typology 即类层次"的合成数据设计法可迁移到国内 AML 特征工程的测试数据构造:把 FATF typology 文档中的行为模式(structuring/分层/骡子网络/链上桥接)编码为可参数化的 actor 类,比"随机注入异常点"的合成器更接近真实调查场景,生成的数据直接可测规则引擎的 typology 检出路径。脏数据注入器(15% 噪声四类)也呼应数据质量门主题。⚠️ 仅 Bronze/Silver 两目录、无模型层、16KB 体量小、typology 参数未见调优。与 反洗钱-AML 的 typology 检测相关。→ GitHub
6. intelligent-payment (jamoloto-dev) — 支付平台语境下欺诈服务的集成视角样本(六微服务拓扑中 Fraud Service 独立成服务:规则启发式评分查交易 velocity/地理一致性/账户年龄/异常金额,>80 分拒付;FraudReviewRequired 事件经 Redis Pub/Sub 异步解耦不阻塞结账延迟;幂等键防重复扣款+行级锁防超卖;ONNX/XGBoost 替换规则引擎列 Roadmap 而非冒充已有)【信号:★】
jamoloto-dev/intelligent-payment(0★, Python/FastAPI, 08-28 建→08-28 推送, 14 commits, 122KB)是完整电商支付平台(用户/商品/订单/支付/欺诈/通知六微服务+API 网关),欺诈检测作为其中一个服务的集成视角:确定性规则启发式评分(velocity/地理一致性/账户年龄/金额异常四维)>80 拒付(HTTP 400 Payment Fraud Rejected)、50-80 触发 FraudReviewRequired 事件走 Redis Pub/Sub 异步人工审查、审计日志落 Azure Table Storage 不可变存储。工程完整度高:幂等键防重复扣款、原子行级库存锁、K8s+docker-compose 双部署、CI 徽章、"ML 欺诈引擎(ONNX/XGBoost)"列 Future 而非冒充已有(诚实申报文化的又一例)。
风控视角:对国内读者价值在"欺诈服务在完整交易平台中的位置":不是孤立的 notebook 而是六服务拓扑中独立部署、独立数据库(MongoDB/Azure Tables)、事件驱动异步审查、审计轨迹不可变化的一等公民——这正是"风控服务化/中台化"的微服务样本。四维规则评分(velocity/地理/账龄/金额)是最小可行规则集参考。⚠️ 新仓 1 天 14 commits、Stripe sandbox 语境、规则权重与阈值未见校准说明。与 实时风控引擎 的服务化架构相关。→ GitHub
技术趋势
- 监控器本身成为被评估对象:mlops-fraud-pipeline 证明 PSI×AUC 退化相关性可为 −0.71(信号指错方向)、label shift 对特征监控结构性不可见、100% null 列让 KS 报"健康"——"评估即证据链"弧线(08-26 预注册→08-27 conformal 代价→08-28 对抗逃逸)推进到监控层:监控信号必须先测与真实退化的相关性再接 pager。
- 合规豁免的实测补位:EU AI Act Annex III 5(b) 明文豁免欺诈检测的高风险分类,但 793× 拦截速率差与 FN 差距一个数量级的实测说明豁免≠无害——"监管盲区里的自我治理"(self-audit)成为合规新姿态;FN vs FP 差距分层报告比 disparate impact 比率更贴近"客户投诉 vs 资损"双维度。
- 弱标签构造路径多样化:LEIE 排除名单交叉(今日 cms)与基准标注(昨日 lurescope)呼应——"标签怎么来的"是评估证据链的最上游问题;无监督方法用事后真标签验证重合度的对照设计成为标准动作。
- 诚实申报文化持续扩散:DP 代价明示+成员推理攻击自测列 roadmap(federated-gnn)、ML 引擎列 Future 而非冒充(intelligent-payment)、监控器自身 bug 全文披露(INCIDENT.md)——"报告漏了什么"比"报告抓住了什么"成为高质量仓库的标志。
- 联邦图学习骨架最小化:FedAvg+DP 选项+GNNExplainer 的最小可跑框架(对照 08-24 mulenet 的量化实验)——跨机构联防的演示起点与实验底座分层成形。
行业案例
- 生产 ML 监控自我审计:mlops-fraud-pipeline(INCIDENT.md 注入失败×3 全中+2 控制组零误报+负相关发现)
- EU AI Act 合规自审计:ai-act-fairness-audit(Annex III 5(b) 豁免+442,905 笔/1% 预算运营阈值审计)
- 医疗支付欺诈:cms-open-payments-fraud(Open Payments×LEIE 弱标签+有监督/无监督对照)
- 跨银行联邦图学习:federated-gnn-fraud-detection(FedAvg+DP+GNNExplainer 最小框架)
- AML 合成数据:end-to-end-aml-pipeline(四 typology actor 类+15% 脏数据注入)
- 支付平台欺诈服务化:intelligent-payment(六微服务中独立 Fraud Service+事件驱动审查)
值得深入
- mlops-fraud-pipeline 的 INCIDENT.md——三种注入失败的完整复盘(含阈值双向调错史)+监控器自身三个 bug 的发现过程,"监控的监控"一手素材。
- ai-act-fairness-audit 的 README §1-§3——从"确信是高风险系统"到"读原文发现明文豁免"的完整推理链+不可能三角的三策略实测表。
- cms-open-payments-fraud 的
src/data/clean_data.pylabel_fraud实现——排除名单交叉弱标签的具体做法(NPI/日期匹配、不平衡声明)。