风控日报 — 2026-08-25
📊 原料:44 条相关条目(GitHub 仓库搜索 33 条 / arXiv 11 条全部无关——新批次
2608.21xxx(08-21 提交日期):QED 真空非线性光子态、太空采矿机器人、撒哈拉以南 AI 诊断 agent 治理、牛顿法原始加速、PerturbRx 药物响应预测、序列预测校准度量真实性理论(校准主题沾边但纯博弈论无风控应用)、AI 权限与验证、OmniAssistBench 全模态助手基准、定价面板不确定性、流匹配难度校准插值、Lanczos 有限精度稳定性)。arXiv 全噪声小计:连续 30 期(07-17→08-25)全噪声,累计 723+ 条中 1 条相关,噪声率 99.9%。剔除构成:~19 条已覆盖/非风控残留(marketplace-phaas-tracker[08-15★已覆盖]、antifraud-knowledgehub[08-12]、disposable-email-detector、justcheckingmate[08-09]、eramitgupta-disposable-email、lucidfence[08-07]、FFraud-com×2[数据库]、jd-capital-terminal[08-20]、xm2325/payment_fraud_decisioning[08-24]、victig[08-14]、ChinnaDevelopers/LLMs-for-GFDs[08-24 空模板]、Raihankoduvaly[08-24 文档only]、invariant-CaT-GNN[08-24]、prompt-integrity-validator、agent-standup、SecCheck[韩企审查]、accessai[WCAG 无障碍非风控]、portfolio-risk-engine[投资组合]、TemporalStore[LLM 记忆])+ upishield 重复剔除(07-01 已覆盖,同仓同指标 333 txns/sec @2ms p99)+ finpulse-trading-engine 剔除(声称体量不匹配:README 自称机构级亚微秒撮合+React 终端,仓库仅 22KB,徽章指标幻觉家族)+ R23Yadam/trading-engine(市场侧交易模拟,确定性回放设计不错但非风控)。连续 1 日无新确认恶意仓库(上日 08-24 新增 1 个),累计维持 20 个;残留不重复验证:yoelpa6680/upi-fraud-gnn(07-26)、primatewakeisland574/payment-channel-guide(08-09)。今日筛出 8 条新增高信号条目。今日核心亮点是 txwatch 的 v2→v3 模型迭代故事——离线 0.948 AUC 的 432 特征模型在生产坍缩到 ~0.66(413 个特征线上不可得),重训只吃线上拿得到的 39 个特征后离线即生产;以及三件 Razorpay AI Buildathon 同赛作品(sentinelpay/RecoverAI/AI-Risk-Manager)同日涌入关键词搜索的"黑马拉松浪潮"。
今日高信号
1. txwatch (TxWatchCore) — "只训练你线上拿得到的特征"(IEEE-CIS 590K 三版模型迭代:v2 离线 0.948 AUC 生产坍缩 ~0.66(413/432 特征不可得)→ v3 只用 39 个可供给特征 0.928 离线即生产 + 7 策略 SHAP 延迟基准 + 服务实现状态诚实申报)【信号:★★★】
TxWatchCore/txwatch(1★, Python, 2026-02 创建→08-24 持续推送, IEEE-CIS 590,540 交易 / 3.5% 欺诈基率, docker-compose 四件套 Redis/PG/Kafka/ZK)是一个"卡交易实时反欺诈"服务群,但真正的高信号是它的模型版本迭代方法论:v1(18 精选特征)离线 0.896 但依赖推理时不可得特征不可上线;v2(全量 432 特征)离线 0.948\*——星号诚实标注"离线虚高:生产只拿得到 ~19 个,其余零填充,服役形态坍缩到 ~0.66 AUC / 5% 精确率";v3(39 个真实可供给特征:原始交易/卡/邮箱域 + M-match 标志 + D-recency)离线 0.928 就是它在线上交付的水平,且每条 SHAP 解释引用的都是真实在场的信号。三版在同一 held-out 切分(random_state=42)上对比,结果表直接印在 README。
第二个亮点是 SHAP 策略基准:services/inference/benchmark.py 对 7 种 SHAP 策略对比精确 TreeSHAP——reduced_tree(子采样背景)3.8ms vs 精确 67.6ms(18× 提速 @ ~0.017 MAE)是甜点;async_posthoc 把 SHAP 移出热路径换取无解释响应。还有三处工程纪律:(1) Kaggle 规则合规——数据集 gitignore、训练产物(ONNX/LightGBM)入库、SHAP 背景集用种子化脚本再生(字节一致);(2) 服务状态表逐项申报(inference/feature/audit 已实现,decision/gateway 明示 scaffolded);(3) 决策策略当前住在推理 sidecar 的双阈值里(0.90 自动 BLOCK @71% 精确率 / 0.50-0.90 进人工),抽出独立 decision 服务的计划写明。
风控视角:"特征可得性"是一等建模约束的量化教材:国内面试与生产反复撞到的"离线指标漂亮、上线拉胯",这里第一次给出三版本对照的完整解剖——问题不是分布漂移而是特征契约缺口(训练用了线上拿不到的 413 个字段)。与 08-10 Sentinel 的 feature_spec.json 零 skew 契约、08-11 PaymentFeatureEngineer 变压器封装同谱系但更根本:先盘点 /score 请求实际能带什么,再定特征集。SHAP 7 策略基准是"解释的延迟预算"第一次被系统测量,直接可抄进任何要在线出 SHAP 的系统。与 风控模型 的特征工程与 实时风控引擎 的推理服务直接相关。→ GitHub
2. SentinelPay (adarshthakur9240) — 极端不平衡 0.17% 全家桶 + SHAP 拒付争议证据卷(ULB 284,807/492:scale_pos_weight=578.55 精确类比例胜 SMOTE + 成本最优阈值 t=0.10($5 FP 摩擦 vs $122.21 FN 拒付)+ 保序校准 ECE 0.04%→0.01% + GraphSAGE vs 经典图基准诚实研究 + NetworkX 风险扩散 + Kafka 滑动窗口 + live 三端验证)【信号:★★★】
adarshthakur9240/sentinelpay(0★, Python+Next.js, 08-23 创建→08-24 推送, 13MB, Razorpay AI Buildathon Track 02 提交, live Vercel + Render 实测 200)把"信用卡欺诈教科书栈"一次做齐:(1) 不平衡处理——ULB 数据 492/284,807(0.17%),LR 基线先行(6.73% 精确率/901 误报),XGBoost 用精确类比例 scale_pos_weight=578.55 胜过 SMOTE(79.75% 精确率/85.14% 召回,PR-AUC 0.8424);(2) 成本敏感阈值——拒绝 θ=0.5 惯例,参数化扫描 $5 FP 审查摩擦 vs $122.21 FN 拒付损失,最优 t=0.10;(3) 校准——保序回归 ECE 0.04%→0.01%;(4) 流式——Kafka 5 分钟滑动窗口 velocity 消费者 + 1.15× 风险集成加成 + WebSocket 实时馈送;(5) 图智能——NetworkX 连通分量 + 风险扩散找出"0% 孤立风险"的共谋节点;(6) 诚实研究——GraphSAGE vs 经典图基准、负结果披露、模拟组件公开标注("Scientific Honesty" 是评分维度之一)。
差异化亮点是"拒付争议证据生成器":SHAP TreeExplainer 输出被打包成 dispute evidence dossier(/evidence 页面)——为拒付抗辩(chargeback mitigation)生成数学归因证据,风险引擎的产出第一次瞄准争议流程而非仅决策本身;且明示"advisory-only、零自动阻断能力"(Defense-Only Scope)。
风控视角:实践密度本周最高的单仓:类比例 vs SMOTE 的对照、成本阈值扫描、校准曲线、图基准诚实研究——四个常见面试考点一仓全覆盖,且每项都有 docs/ 证据文件。拒付证据卷是"SHAP 进业务流程"的新形态(解释不只给分析师/监管看,还给卡组织争议裁决看)。⚠️ 黑马拉松提交、全合成公开数据集、评委导向 README(评分维度映射表)。与 08-12 freyabytes/SentinelPay 同名不同仓。与 风控模型 的成本敏感决策与 反欺诈体系 的拒付治理直接相关。→ GitHub · Live
3. mule-fraud-detection (lakshaygaba18) — 骡子账户 GNN + 无标签漂移监控三件套(拓扑特征 pass_through_ratio/velocity_hours + PSI 特征与分数漂移 + JS 散度解释模式漂移 + FastAPI/前端,"标签永远迟到"的生产假设写进 docstring)【信号:★★】
lakshaygaba18/mule-fraud-detection(0★, Python/PyTorch Geometric, 08-24 创建,无 README 但代码全部真实)是骡子账户检测的紧凑实现:GraphSAGE 二部图(sender→receiver 边 + 账户节点特征),特征是七个图拓扑量(in_degree/out_degree/unique_senders/unique_receivers/pass_through_ratio/velocity_hours/in_span_hours)——"过路账户比率"与"资金在户时长"正是骡子账户的业务本质;基线模型 + GNN 双轨(baseline_model.json + gnn_model.pt 在仓),simulate_data/simulate_drift_batch 两套模拟器分离常态与漂移批次。
真正的高信号是 drift_monitor.py(260 行)的"无标签漂移三件套":(1) 特征分布 PSI(分位桶,阈值 0.10/0.25 沿用银行业模型风险团队惯例,docstring 明示"PSI 比 KL 更适合合规面板因为 KL 无固定标度");(2) 分数分布漂移——直接监控 risk_score 本身而非只看输入;(3) 解释模式漂移——用 JS 散度监控 explanation-tag 分布的偏移。docstring 开宗明义:"不需要新真值标签(生产里标签永远迟到)"——把标签延迟当作漂移监控的存在理由,与 08-19 延迟标签特征工程、08-24 payment_fraud_decisioning 标签延迟泄露实验同题但落在监控侧。
风控视角:"解释漂移"是解释资产化的下一步:08-24 transparent-graph-fraud-xai 把解释保真度做成评估指标,这个仓把解释分布做成了线上监控对象——当 SHAP 归因的 top 特征构成开始漂移,即使分数稳定也值得排查(特征重要性坍缩=模型在换理由,常是攻击适应的前兆)。PSI/JS 双度量 + DriftReport 数据类可直接进 dashboard 或合规日志。⚠️ 无 README、单人仓、模拟数据。与 风控模型 的模型监控和 图风控 的骡子账户检测直接相关。→ GitHub
4. AI-Risk-Manager (gopal-labs) — 印度 UPI 风险全功能台(复合评分 0.4 规则+0.45 ML+环加成 + UPI collect 滥用低信任 VPA 后缀规则 + SIM swap 速度 + NetworkX 五节点二部图环检测 + FP 摩擦成本滑杆 + HITL 队列 LLM 摘要确定性回退 + 反馈再训练端点)【信号:★★】
gopal-labs/AI-Risk-Manager(0★, FastAPI+React, 08-24 创建,Razorpay AI Builder Track 2,F1-F10 PRD 覆盖表全 ✅)是商户+交易双侧的风险情报平台。UPI 专属信号是最有价值的部分:collect request abuse 规则针对低信任 VPA 后缀(@ybl/@paytm/@ibl)+ 高金额 + 速度尖峰的组合;设备与 SIM 变更速度检测 ATO(SIM swap velocity × 陌生设备绑定);规则运行时可经 /upi/config 热切换——印度支付生态的具体对抗手法第一次以规则参数形式开源。复合评分有硬阻断地板 88.0(硬规则触发即兜底)与三段风险带(≥70 DANGER/≥40 WATCH/<40 SAFE);FP 成本仪表盘(F8)把阈值滑杆与 FP 摩擦成本(₹500/次)、单 TP 止损(₹12,500)、净财务影响联动——阈值治理的产品化;反馈环(F10)从分析师三态决策(confirmed_fraud/false_positive/needs_investigation)计算一致率并触发再训练。
风控视角:UPI 对抗手法的规则化样本:08-17 三连 UPI 工程(PayShield/Sentinel UPI/DPFRIS)之后,UPI 主题的第四次出现——这个仓补的是"收款请求滥用"这个 UPI 独有向量( pulls 付款而非 push 付款,欺诈面完全不同)。LLM 摘要带确定性回退(无 API key 时降级到模板生成)与 08-24 app-fraud-interdiction 的"LLM 不碰决策"同族但用在 HITL 队列。⚠️ 黑马拉松提交、合成数据、评分权重(0.40/0.45)为手调。与 反欺诈体系 的 ATO 与营销滥用、风控策略 的阈值治理相关。→ GitHub
5. RecoverAI (AdithyaAbburi) — 支付失败回收的有界自治 agent(六段管线:确定性风险分 → 本地 LLM 根因诊断 → ERV 期望回收值优化器 → 确定性策略护栏(MAX_ATTEMPTS=2/≥INR 25K 人工) → 种子化模拟器执行 → 不可变审计 + 千例三臂对照 32.1%/51.5%/66.0%)【信号:★★】
AdithyaAbburi/RecoverAI(0★, Python 3.13/FastAPI/Streamlit, 08-24 创建,Razorpay AI Buildathon Track 03 收入回收赛道)做的是支付风控的邻接场景——失败支付的收入回收(dunning/revenue recovery):交易失败流入 → 确定性风险引擎打 0-100 → 本地 DeepSeek-Coder:6.7b(Ollama CPU) 诊断根因(结合 LTV/逾期发票/交易日志)→ ERV 优化器选动作:期望净回收 = 成功率×金额 - 运营成本 → 确定性策略引擎终审(重试上限 2 次、退订用户禁触达、≥INR 25,000 强制人工)→ 有界工具执行 → SQLite 不可变审计。评估是千例合成失败三臂对照:朴素重试 32.1% / 静态规则 51.5% / agent 66.0% 回收率,策略违规率 0%、停机规则合规 100%(MAX_ATTEMPTS=2 被强制执行)——同一模拟器种子保证可比。
风控视角:"LLM 建议、确定性否决"的又一独立样本:与 08-24 app-fraud-interdiction(决策核心纯 stdlib)、08-12 FraudLens(LLM 仅引用不可覆盖)构成三仓同构——agent 时代的风控系统里 LLM 的位置收敛为"诊断/叙述",钱的动作永远过确定性策略门。ERV 把"重试几次"从拍脑袋变成期望值优化,与 08-24 payment_fraud_decisioning 的 P×(amount/median)^α 同为"金额感知决策"家族。支付失败回收本身是国内支付团队(断网重试/代扣失败挽单)真实场景。⚠️ 黑马拉松、全合成评估、本地小模型诊断质量未验证。与 实时风控引擎 的决策服务化和 风控策略 的护栏设计相关。→ GitHub
6. pix-sentinel (guivital1) — 巴西 PIX 实时风险管道(SQS+Lambda+S3+Athena 事件驱动 + 五信号加权可解释评分 + 版本化 schema 契约/部分重试/确定性去重/DLQ/有界重放 + 成本kill switch 默认关 + 已验证云上运行记录)【信号:★★】
guivital1/pix-sentinel(0★, Python 3.11, 08-22 创建→08-24 推送, AWS SAM IaC, live 风险监控页实测 200)是巴西 PIX 即时支付的可解释事件驱动风控演示:合成 PIX 流 → 加密 SQS(带死信队列)→ Lambda 评分(两小型 ARM 函数)→ S3 小时分区湖 → Athena 查询 → 交互监控页。评分是五信号加权表(超高金额 35/极端速度 30/新设备 18/新账户 12/异常时段 10,封顶 100),每条告警保留触发信号明细——"决策可审计而非黑盒预测"。可靠性五件套:版本化 schema 契约、部分批次重试、确定性微批去重、DLQ 隔离、有界重放,CloudWatch 监控队列年龄/消费者错误/死信。成本纪律最突出:调度默认禁用(部署不产流量)、数据 30 天过期、SAM 参数一键开关,且 README 附已验证云上运行记录(08-23 受控执行 25 事件/5 微批/零错误,取证后环境即拆除)。
风控视角:"成本感知基建"的模板级样本:云上风控演示最常见的翻车是忘关调度烧钱——这个仓把 kill switch 做成默认态并把"取证后拆除"写进流程,是作品集工程与真实云成本意识的结合。PIX 是.digests 里第一次出现的巴西支付轨道(此前 UPI/M-Pesa/PesaLink 已多次),新兴市场即时支付风控的轨道光谱又补一格。五信号加权 + 明细留存的"可解释优先"与 08-13 nikorokni 六维度加权同族。⚠️ 合成数据、评分规则简单(深度在管道不在模型)。与 实时风控引擎 的事件驱动与可靠性直接相关。→ GitHub · Live
7. hybrid-gnn-fraud-intel (imbeka06) — 肯尼亚移动货币欺诈五拓扑平台(GNN+XGBoost 堆叠混合 + Neo4j 实时图 + 五类具名欺诈拓扑(代理反转环/骡子+SIM swap/快速提现爆发/贷款"提喻环"/商户异常 densification)+ CBK AML 合规格式 + 公民/分析师双角色 UI,live 部署在线)【信号:★★】
imbeka06/hybrid-gnn-fraud-intel(2★, Python+React, 2026-03 创建→08-24 持续推送, 40MB, live Netlify 实测 200, 6 个月持续维护)面向肯尼亚移动货币生态(M-Pesa 类):混合集成 = GNN 结构模式识别 + XGBoost 速度检测,五类具名欺诈拓扑直接对齐东非真实手法——Agent Reversal Scam Rings(带反转的环形交易)、骡子+SIM swap(共享设备星型网)、Fast Cash-out Explosions(短窗高速爆发)、Loan Fraud "Synecdoche Circles"(默认违约的密集隐蔽社区)、商户异常 densification。三模型并存可比(baseline XGBoost/GNN/Stacked Hybrid),Neo4j 实时图可视化,FastAPI 后端跑模型评估脚本,CBK(肯尼亚央行)AML 合规格式报表页,告警队列带分析师 approve/deny 动作;双角色入口(普通用户 mwananchi / 专家端)。
风控视角:新兴市场欺诈拓扑的具名清单有价值:五类拓扑里"代理反转环"与"贷款提喻环"是移动货币代理体系(agent network)特有的手法,成熟卡支付体系里没有对应物——对做跨境/新兴市场支付风控的读者这是稀缺的对抗面目录。CBK AML 格式合规输出对应"检测→STR 草稿"链路的本地化(与 08-10 ChainLens 台湾 VASP STR 草稿同模式)。6 个月维护+真实部署在 0-2★ 仓里少见。⚠️ 文档仓结构偏多(PHASE_3_COMPLETION_REPORT 等过程文档入库)、模型对比指标待复核。与 图风控 的拓扑检测和 反洗钱 的 STR 生成相关。→ GitHub · Live
8. fraud-detection-system (azezsarisari) — 部署在线的 PaySim 全周期基线(RF + 时间泛化/泄露评估 + 特征消融 + SHAP + Railway 双服务 live 健康验证 + Docker/测试)【信号:★】
azezsarisari/fraud-detection-system(0★, Python, 08-24 创建, Streamlit + FastAPI 双 Docker, Railway 部署实测 200:dashboard 正常渲染、/health 返回 {"status":"healthy","model_loaded":true})是 PaySim 上的端到端 ML 全周期实现:数据分析→特征工程→多模型对比→不平衡分析→阈值优化→SHAP→时间泛化与数据泄露评估→特征消融→API→仪表盘→容器化→云部署。每笔交易输出类别/概率/风险等级三级告警。
风控视角:"全周期 checklist 的最小可信实现":单项无突破,但把时间泛化评估与泄露检查列进标准流程、双服务真实部署且健康检查通过,作为全周期学习地图与"部署真的跑起来了"的底线样本。与 08-24 ARGUS 七层栈相比深度不足、完整度相当。⚠️ PaySim 高度饱和、教学级。与 风控模型 的评估体系相关。→ GitHub · Dashboard · API
技术趋势
- "只训练你线上拿得到的特征"成为显式方法论:txwatch 的 v2→v3 三版对照(离线 0.948 生产坍缩 ~0.66 → 39 特征 0.928 离线即生产)第一次把特征可得性缺口(不是分布漂移)量化成完整案例——防泄露/防 skew 纪律光谱(08-10 契约→08-11 变压器→08-13 密封边界→08-18 泄露量化→08-24 三权分立)延伸到最上游:特征集定义本身。
- 印度 Razorpay AI Buildathon 单日涌入三仓(sentinelpay/RecoverAI/AI-Risk-Manager):黑马拉松成为开源风控工具的批量生产源——上侧是实践密度高(成本阈值/校准/护栏/诚实表全齐),下侧是合成评估与评委导向 README;识别赛事背景(Track 编号/评分维度映射表)应成为 triage 常规步骤。
- 解释资产化再进两步:SHAP 策略延迟基准(txwatch 7 策略、reduced_tree 18× 提速)给"在线解释"定了预算表;解释模式漂移监控(mule-fraud-detection 的 JS 散度监控 explanation-tag 分布)把解释从输出变成被监控对象——与 08-24 解释保真度五指标前后呼应,"解释工程"正在成形。
- "LLM 建议、确定性否决"模式三仓同构确认:RecoverAI(ERV+策略门+人工队列)与 08-24 app-fraud-interdiction、08-12 FraudLens 独立收敛——agent 时代风控的 LLM 位置共识从"不碰决策"细化为"诊断/叙述/建议,钱的动作过确定性门"。
- 拒付争议成为风控输出新靶点:sentinelpay 把 SHAP 归因打包成 chargeback dispute dossier(给争议裁决的证据,不只给决策)——风险引擎产出从"拦不拦"扩展到"抗辩材料"。
- 成本感知基建默认化:pix-sentinel 的调度默认关+30 天过期+取证即拆除,与 08-24 financial-risk-engine 全免费层五件套同向——云上风控 demo 的成本纪律成为新的作品集区分度。
行业案例
- 卡交易欺诈:txwatch(IEEE-CIS 三版模型:特征可得性约束下的 0.928 即生产)
- 信用卡极端不平衡:SentinelPay(ULB 0.17%,类比例 578.55 胜 SMOTE + 拒付证据卷)
- 骡子账户+监控:mule-fraud-detection(过路比率/在户时长拓扑特征 + PSI/JS 无标签漂移三件套)
- UPI 收款滥用:AI-Risk-Manager(低信任 VPA 后缀 + SIM swap 速度 + FP 成本滑杆)
- 支付失败回收:RecoverAI(ERV 期望值优化 + 千例三臂对照)
- 巴西 PIX:pix-sentinel(SQS/Lambda/Athena 五信号加权 + 成本 kill switch)
- 肯尼亚移动货币:hybrid-gnn-fraud-intel(五类具名欺诈拓扑 + CBK AML 格式)
值得深入
- txwatch 的
benchmark.pySHAP 七策略实现——reduced_tree 的子采样背景怎么做、MAE 怎么测、async_posthoc 的响应内解释契约——整理成"在线解释延迟预算"答题素材。 - mule-fraud-detection 的
drift_monitor.py(260 行可通读)——PSI 分位桶边界处理、JS 散度在解释 tag 上的应用、DriftReport 数据类的面板/合规日志双用途设计。 - sentinelpay 的
docs/cost_analysis.md——$5 FP/$122.21 FN 的参数化扫描曲线与 t=0.10 的推导,对照 08-20 fraud-policy-ab-test 的非劣性 guardrail 补全"成本敏感阈值"答题框架。 - pix-sentinel 的 cost-safety 文档与 SAM 参数化——"默认不产流量"的云上 demo 成本纪律如何模板化。