风控日报 — 2026-08-17

📊 原料:45 条相关条目(GitHub 仓库搜索 34 条 / arXiv 11 条全部无关——与 08-15 完全相同的 2608.135xx 批次(论文 ID 逐一相同:QKD 因果序、TESS、单量子比特、AutoDesign、OmniScientist、V-RAE、Defensive Boosting、Jaccard、Clifford、Toeplitz、核子 V_B),API 缓存重现(同 07-26/07-27 模式),已知噪声直接跳过)/ HN 21 条和 Trending 20 条经去重后无风控相关条目入选)。arXiv 全噪声小计:连续 23 期(07-17→08-17,跳过 07-25、08-16 和其他无调度日)全噪声,累计 664 条中 1 条相关,噪声率 99.8%。~18 条已覆盖、非风控或数据库/stub 剔除(lucidfence [08-07]、antifraud-knowledgehub [08-12]、marketplace-phaas-tracker [08-15]、home-test-membrane-labs [08-15]、SupplyChain-Risk-Engine [08-14/非金融]、perishable-inventory [非金融]、FFraud-com ×2 [数据库]、api-evangelist ×2 [公司画像 stub]、pgrecon/prompt-integrity-validator [非风控]、mault [TCG 硬件分拣]、gsd-2 [coding agent]、co-rar [Claude 插件]、graph-fraud-ai [08-13]、FinGuard-AI [08-14 空仓]、fraudguard-frontend [验证确认:NestJS 后端不存在,纯 MSW mock 的前端壳,"sub-100ms/vector search" 均为 mock 响应])。⚠️ 恶意仓库:新确认 2 个,同日 08-16 README 改造浪潮——bintang3703/fraud-detection-credit-mlops真实作品集劫持:2026-03/04 葡语 Streamlit 真实应用 + 08-16 单次 README 改造为 in-repo zip 下载漏斗 data/detection_credit_fraud_mlops_1.7.zip,08-15 变体复发)和 paulineconsuming416/upi-fintech-analysis生成账号诱饵:真实 notebook+CSV 作掩护,README 徽章指向 visuals/upi_analysis_fintech_3.4.zip,重复 3 次 + "Extract All" 话术)——版本化 zip 命名(_1.7/_3.4)= 同一活动模板,累计已确认 17 个恶意仓库。持续残留 7 个不重复验证:defi-risk-screening(07-26)、Syntecxhub(07-27)、VPN-Detector(07-26)、payment-channel-guide(08-09)、cross-border-fraud-detection(07-26)、upi-fraud-gnn(07-26)、aml-checker-pro-master(07-29)。今日筛出 7 条新增高信号条目,UPI 生态占 3 条。今日核心亮点是 PayShield——一个 GNN+规则+LLM 三层混合的 UPI 欺诈检测引擎,L2 图模型带 40ms 超时守卫和规则回退、诚实指标(GNN PR-AUC 0.4125 vs 无边 MLP 0.1028,4.0× 归因)和 19-bug 修复日志(含 PSI 估计器修正 43.4→3.86),是混合架构 + 诚实评估文化的工作参考。

今日高信号

1. PayShield (purvanshh) — UPI 欺诈检测三层混合引擎(L1 统计规则 12 条 Redis velocity/geo/Benford + L2 PyG HeteroConv/GraphSAGE 条件融合 + 40ms 超时守卫→L1 回退 + L3 异步 LLM 调查 Celery+Ollama + PSI 漂移 + 哈希链审计 + 诚实评估 GNN PR-AUC 4.0× 归因 + 19-bug 修复日志)【信号:★★★】

purvanshh/PayShield(0★, Python FastAPI + PyTorch Geometric + Celery, 2.4MB, 113 commits 2026-07-29→08-15 密集提交, 全合成数据 + 诚实自审计)是一个三层递进式 UPI 欺诈检测引擎——每层有真实代码(389 blobs),每个架构层都可验证。

三层架构

内容 关键设计
L1 统计规则 12 条规则(velocity/geo/Benford),Redis 后备 快速基线 + L2 失败时的回退层
L2 图模型 PyG HeteroConv + GraphSAGE 条件融合 40ms 超时守卫——超时降级到 L1
L3 LLM 调查 Celery + Ollama qwen2.5:3b 异步(~35s) 12 个具体 agent + 2 个 infra(诚实承认 3 个 stub)

诚实评估文化:(1) GNN 边的归因实验——PR-AUC 0.4125(带图结构)vs 无边 MLP 0.1028,4.0× 提升归因于图信息而非模型容量;(2) 19-bug 修复日志公开记录,含 PSI 估计器修正(43.4→3.86);(3) model cards 主动纠正早期夸大("AUC>0.92 从未实测过");(4) 每周门控重训工作流(improvement-gate)。

合规工程化:PCI/RBI/EU-AI-Act 检查器是程序化代码而非文档声明;JWT+API-key+TOTP 认证;Prometheus/Grafana 可观测。

风控视角:GNN+规则+LLM 混合架构的生产形态参考:(1) 40ms 超时守卫 + 规则回退是"模型不可用时降级"的弹性设计——实时风控引擎中 GNN 推理超时回落到统计规则,保证延迟 SLA 不因模型层抖动破裂——这是混合架构最常被忽略的工程问题。(2) GNN 归因实验(4.0×)方法论——用无边 MLP 作对照量化图结构的边际贡献,比单纯报 GNN 指标更可信。(3) 诚实自审计文化(bug 日志 + model card 纠错 + 承认 stub)与 08-14 aghasalim 的决策追踪、08-15 narendranathe 的自列缺陷一脉相承。(4) ⚠️ 全合成数据,指标数值不可直接对标生产。与 反欺诈体系的混合架构和 风控模型的 GNN 评估关联。→ GitHub

2. Sentinel UPI Risk Engine (SyedHuizaifa12) — 实时 UPI 风险引擎(feature_lib 点时正确性测试 + 冷/热双校准器 + 成本矩阵→allow/warn/review/block + reason codes + Redis Streams + PSI 漂移 + 选择性标注偏差设计文档)【信号:★★】

SyedHuzaifa12/sentinel-upi-risk-engine(0★, Python + FastAPI + Redis Streams + MLflow, 11.1MB, 6 commits 全部 08-16, 224 blobs 含测试)是一个事件驱动实时 UPI 交易风险引擎——本批技术密度最高的仓库。

核心实现:(1) feature_lib 特征库——registry + Redis/Postgres/内存三种存储后端 + fan-in 帧聚合 + 专门的点时(point-in-time)正确性测试 tests/test_pit_correctness.py;(2) LightGBM + temporal split(时序切分防泄露);(3) 冷/热双校准器——cold_calibrator.pkl + reliability_cold/warm.json(Brier/ECE),新流量冷启动与成熟流量分开校准;(4) 成本矩阵决策——policy/{cost_matrix,thresholds,decide,reason_codes}.py 生成 allow/warn/review/block 四级决策 + 原因码;(5) 决策日志落 Postgres(decisionlog/);(6) pipelines/drift_check.py PSI 漂移检测 + 回测 harness + CI 门禁。

⚠️ README 滞后(反向描述修正):README 仍描述旧版 "Smart UPI Fraud Detection" Django+RandomForest 应用(3,075 行 Kaggle CSV)——代码已远超 README,limitations 里声明的"无漂移检测/无特征注册表"实际都已实现。读代码不读 README。

教科书级设计讨论:DESIGN.md 对选择性标注偏差(reviewed-case precision 因只审核被标记案例而虚高)和冷启动漂移伪影的处理是生产风控少见的清醒论述。

风控视角:特征平台 + 校准 + 成本决策的紧凑教学实现:(1) 点时正确性有专门测试——特征平台的 PIT 正确性(防特征穿越)通常只在论文里讨论,这里落成了可运行的测试——与 08-13 HarshaSanka 密封边界、08-14 aghasalim 泄露量化构成防泄露工程纪律光谱的第三步。(2) 冷/热双校准器——新渠道/新客群冷启动期的概率失准是生产痛点,分开校准是正解。(3) 选择性标注偏差——人工审核偏差使"审核集精确率"天然虚高,DESIGN.md 的论述值得所有做案件闭环的团队读。与 风控模型的校准和 实时风控引擎的特征平台关联。→ GitHub

3. Robson (ldamasio) — Rust 加密期货执行与风险引擎(月度风险预算+熔断+恐慌 kill switch API + 技术止损定仓公式 ADR-0039 + 双层止损执行 + 对账 worker 自动平仓 + 事件溯源审计 + 7 年 765 commits + ADR 决策记录)【信号:★★】

ldamasio/robson7★ + 4 forks, Rust workspace + SvelteKit dashboard, 121MB, created 2019-12-30, 765+ 人工 commits 近乎持续维护)是本批最成熟的长寿仓库——固定 1x 杠杆加密期货的执行与风险引擎:操作员决定入场,Robson 按确定性风险政策执行和管理退出。

硬限额工程:(1) 月度风险预算——4%/月 + 熔断器 + monthly-halt/panic kill switch API;(2) 定仓公式(ADR-0039)——size = (capital×1%) / (stop_distance + gap_allowance + round_trip_fees),滑点与手续费进分母;(3) 双层止损执行——软件监控层 + 交易所驻留 reduce-only 止损单兜底(软件挂了交易所侧仍触发);(4) 对账 worker(ADR-0022)——自动发现并平掉系统外的未跟踪持仓;(5) 事件溯源审计日志 + SSE 投影;生命周期 Armed→Entering→Active→Exiting→Closed 经治理的 ExecutionQuery 状态机。

风控视角:限额管理/熔断/审计的非 ML 半边教科书:(1) 风控系统 = 预测层(ML)+ 执行层(硬限额+熔断+对账)——robson 是后者的完整参考:预算计量(ADR-0043)、确定性退出语义、fail-safe 设计、审计不变量。(2) 双层止损 = 风控措施的自身容错——"规则引擎挂了谁来拦"对应支付风控的"主引擎超时谁兜底"(与今日 PayShield 的 40ms 超时守卫同一命题)。(3) ADR + runbook + 数据契约版本化的 7 年工程纪律在个人项目里极罕见。市场/交易风控而非支付风控,但限额框架直接可迁移。与 风控策略的限额管理和熔断关联。→ GitHub

4. DPFRIS (the-irritater) — 数字支付欺诈与风险情报系统(XGBoost+Platt 校准 + Isolation Forest + 有状态 velocity 存储 + NetworkX 骡子账户/环检测 + 80/10/10 混合评分→ALLOW/REVIEW/BLOCK + 成本阈值表 + FastAPI/Streamlit/Docker/CI)【信号:★★】

the-irritater/Digital-Payment-Fraud-and-Risk-Intelligence-System(0★, Python, 1.8MB, 15 commits 全部近两周, 48 blobs 含模型工件/测试/报告)是一个混合 ML+异常检测+规则的支付欺诈决策系统——PaySim + 合成印度 UPI 数据。

实现要点:(1) Optuna 调参 XGBoost + Platt 校准(Brier/ECE 评估);(2) fitted Isolation Forest 异常分支;(3) 有状态客户 velocity 存储customer_state.py)——实时风控的特征存储雏形;(4) NetworkX MultiDiGraph 骡子账户/资金环检测graph_fraud.py);(5) 混合风险引擎 80/10/10(ML/异常/规则加权)→ ALLOW/REVIEW/BLOCK;(6) 成本最小化阈值表落盘(reports/threshold_cost_table.csv);(7) FastAPI + Streamlit + Docker + CI + 6 个测试模块。

风控视角:混合权重评分的紧凑参考实现:(1) 80/10/10 显式加权融合——把 ML 分、异常分、规则分线性组合为 composite score 0-100,是"规则+ML 如何共存"最直接的答案之一(与 08-12 SentinelPay 的规则分+ML 概率组合、今日 PayShield 的三层递进形成设计光谱:加权融合 vs 层级递进)。(2) velocity 有状态存储——账户级交易频率特征的内存状态管理,实时风控 feature store 的最小实现。(3) ⚠️ 合成数据 + "production inspired" 定位诚实。与 实时风控引擎的混合评分和 反欺诈体系的骡子账户检测关联。→ GitHub

5. FraudLens (themanoj-025) — 信用卡欺诈检测全栈(6 模型对比 + XGBoost 部署 + SHAP + 业务成本阈值优化 + FAISS 相似案例 RAG + Claude LLM 叙事 + MLflow 漂移 + k8s/locust/CodeQL ⚠️ GitHub 活动 farming)【信号:★】

themanoj-025/Credit-Card-Fraud-Detection-System(0★, Python FastAPI + Streamlit, 370KB, 44 commits, 2026-08-15 创建)是一个 Kaggle creditcard.csv 上的全栈欺诈检测系统——predict/explain/chat/similar 四组 FastAPI 路由 + Streamlit 五页 UI。

实现要点:(1) 6 模型对比、XGBoost 部署、SHAP 解释;(2) business_cost.py 阈值优化——业务成本最小化的决策阈值(成本敏感决策连续第 5 日出现);(3) PR-AUC 主导评估 + 无泄露标准化声明 + LightGBM 工件不匹配的诚实披露;(4) FAISS 相似案例 RAG——调查员查历史相似案件;(5) Claude LLM 案件叙事 + MLflow 漂移 + k8s 清单 + locust 压测 + CodeQL/gitleaks CI。

⚠️ GitHub 活动 farming 红旗:近期 commits 全是 chore: automated activity trigger (#NN) 机器人提交,27 个 open issues 均为自生成的 bot 刷屏——真实代码之上的活动美化。评估仓库时"commit 数量"这一信号已被污染,需看 commit 内容分布。

风控视角:分析师工具组合的新噪音信号:(1) 相似案例 RAG(FAISS)+ LLM 叙事——案件调查的"找相似 + 写摘要"自动化,是 LLM 在风控调查环节最落地的两个用途。(2) 活动 farming 作为仓库可信度新噪音——commit/issue 数量可刷,验证时必须抽样 commit message 内容。与 风控模型的评估和 反欺诈体系的调查工作流关联。→ GitHub

6. GS Risk Engine (xoxo7777) — Java Spring Boot 期权风险服务(Greeks 计算接口 + 输入校验 + Redis 5 分钟缓存 + Python Monte Carlo VaR 服务 + 真实单元测试 + docker-compose 双服务)【信号:★】

xoxo7777/gs-risk-engine(0★, Java Spring Boot + Python, 36KB, 2026-08-16 单日创建, 49 blobs, 无 README)是一个市场风险微服务双件套——Java risk-api(GreeksController/Service + 参数校验 + Redis 缓存)+ Python monte-carlo(Black-Scholes 定价、隐含波动率、相关性模型、Monte Carlo、VaR 计算器,每个模块带真实单测 ~3-5KB)。描述里的 "targeting Goldman Sachs" 是求职话术,仓库内无对应内容。

风控视角:Java 开发者的市场风险服务样例:(1) Java 计算服务 + Python 数值服务的组合架构——Java 做校验/缓存/接口层、Python 做量化计算,是金融风控常见的双语分工。(2) 教科书级 BS Greeks/MC VaR,无持仓限额、无情景引擎、无文档——参考价值在骨架不在深度。与 风控技术地图的市场风险关联。→ GitHub

7. E-commerce Analytics Pipeline (maitruong-data) — 电商支付风险 BI 管道(GCS→Parquet→BigQuery 星型模型 dim/fact + rpt_payment_risk/rpt_payment_gateway 报表层 + Power BI DirectQuery + 应收账款账龄风险 ≠ 交易欺诈 + 诚实记录坏 join)【信号:★】

maitruong-data/ecommerce-analytics-pipeline(0★, Python ETL, 38.7MB, 21 commits, 2026-02 创建)是一个 GCS→BigQuery 星型模型的电商数据管道——覆盖 Shopify/Sapo/Lazada/Shopee/PayPal/MoMo/ZaloPay 数据源,dim/fact 星型 schema 上建 rpt_payment_risk/rpt_payment_gateway 报表层,Power BI DirectQuery 出dashboard。⚠️ 验证修正:这里的 "payment risk" 是应收账款风险(14 万亿 VND >30 天逾期、59% 回收率、网关表现不佳),不是交易欺诈;6M 行数据为合成;README 诚实记录了坏掉的 payment join 和 PayPal 100% 失败工件。

风控视角:风控 BI 报表层的数据仓库参考:(1) **rpt_payment_* 报表层模式**——在 dim/fact 星型模型上为风控指标建专用 reporting 层,是风控数据从明细到报表的标准路径。(2) 应收账款账龄是企业信用风控的核心报表——与交易欺诈不同维度但同属风控数据工程。(3) ⚠️ 合成数据 + receivables 非 fraud,边界要分清。与 风控技术地图的数据工程关联。→ GitHub


技术趋势

行业案例

值得深入

  1. PayShield 的 40ms 超时守卫 + L1 回退——模型层超时降级到规则层,保证延迟 SLA——我们的实时引擎中 GNN/复杂模型调用是否有同等的降级路径?降级期间的风险敞口如何计量?
  2. sentinel 的点时正确性测试——test_pit_correctness.py 把特征穿越防护做成 CI 可运行的测试——我们的特征平台验证流程能否引入同类测试(对每个特征断言"历史时点查询不返回未来数据")?
  3. "08-16 同日改造"恶意仓库浪潮的自动检测——一周内 3 个新恶意样本(08-15×1、08-17×2),签名已稳定(休眠仓库 + 单次 README 更新 + in-repo 版本化 zip)——在采集脚本加 README CTA 检查(zip/exe 关键词 + 非 clone 指令 + 徽章重复)的优先级应提升。