风控日报 — 2026-07-21

📊 原料:47 条相关条目(GitHub 仓库搜索 50 条 / arXiv 10 条全部无关——Vision-Language Assistant for Risky Driving 驾驶情绪反应 [自动驾驶]、Quantum scanning synthetic optical holography 量子扫描全息 [量子光学]、Adaptive Fault Injection for Multi-Layer Self-Healing AI Infrastructure [AI 基础设施运维]、MotionForesight 视频 3D 场景流预测 [机器人视觉]、Searching Videos as Trees 长视频问答 [视频 QA]、Handroid 灵巧手/人形机器人 [机器人学]、Physics-enhanced RL for real-time optimal control [控制理论]、Primordial non-Gaussianity 原初引力波 [宇宙学/天体物理]、Memoryless Best-Choice Problem 最优停止理论 [数学/运筹]、Auditable Trustworthiness Levels in AI Lifecycle Governance [AI 治理,非风控欺诈]——全部 10 篇 arXiv 论文为 2607.161xx 批次,07-17 提交,与 07-17、07-19、07-20 完全一致,arXiv API 持续返回同一批次达 4+ 连续会话,属已知 API 缓存/限流,跳过再分析)/ HN 16 条和 Trending 20 条经去重后无风控相关条目入选)。arXiv 全噪声小计:07-16 打破的连续 24 期 100% 噪声记录后又连续 4 期(07-17、07-19、07-20、07-21)全噪声,但因 07-20、07-21 返回的是 07-16 的陈旧批次(2607.161xx),不重复计入累计(累计仍为 422 条中 1 条相关,噪声率 99.8%)。17 条已在近 1-2 期日报中覆盖或剔除(qalqan-ai [07-20 已覆盖]、defi-risk-screening [DeFi 收益套利非欺诈]、FFraud-com/disposable-email-domains、FFraud-com/ip-fraud-database、eramitgupta/disposable-email、upi-fraud-gnn [yoelpa6680]、salam-ammari Ethereum GNN、ceemv22/sentinelpay、GraphShield、cross-border-fraud-detection、payment-channel-guide [纯文档]、perishable-inventory-risk-engine [食品过期]、phase [游戏规则引擎]、quantcore [期权定价市场风险]、prompt-integrity-validator [prompt linting]、anti-gambling-trader-tw [交易赌博检测]、marketplace-phaas-tracker [07-17 已覆盖]),本轮不重复入选。另有 2 条垃圾/破解项目已剔除(efnciofjioi/aml-checker-pro-master——"Crypto AML Checker Full Version Tool 2026" 软件破解垃圾、devglobalxxx/panama-crypto-license——巴拿马加密牌照咨询服务落地页,非技术项目)。今日筛出 10 条新增高信号条目,覆盖生产级实时欺诈调查平台、Spark Structured Streaming 欺诈评分层、加密货币预入金 KYT 合规网关、银行业务全周期风险分析平台、SBA 信贷 Basel II/III 评分引擎、浏览器指纹库、L4 业务规则 DSL 引擎、MDM 可解释地理围栏风控、浏览器端欺诈图谱检测 Demo、假招聘检测 ML 系统等方向。

今日高信号

1. SentinelAI (SallaguntaRaahul) — 实时欺诈检测与调查平台(FastAPI + XGBoost + SageMaker + Bedrock + SHAP + MLflow + Terraform 全栈)【信号:★★★】

SallaguntaRaahul/sentinel-ai(0★, Python)是一个诚实标注的生产级架构参考实现,核心是实时支付/电商交易评分 + 调查案件管理 + GenAI 案件摘要三合一。决策 API(POST /api/v1/fraud/decisions)具备幂等检查、特征检索(Redis velocity 特征 + DynamoDB 账户状态)、XGBoost 模型评分 + 规则兜底、决策引擎(阈值+硬规则)、审计事件流(Kinesis)。异步解释服务在支付路径外用 SHAP + Bedrock 生成证据锚定的调查摘要(grounding 检查失败则回退到确定性模板)。亮点是 README 用表格诚实标注每个模块的"已构建 vs 仅设计"状态(Terraform 已编写未 apply、SageMaker Pipeline 编排代码未测试),区分 measured/target 指标。

风控视角:这是"训练-服务特征一致性"工程纪律的教科书级参考:(1) 共享 sentinel_common 库同时被决策 API 和训练管道引用,从代码层面防止 training-serving skew——这是面试常考的"特征一致性"问题的完整工程解。(2) SHAP 解释异步化在支付路径外——实时决策只走 XGBoost 评分,SHAP + Bedrock GenAI 摘要通过 Kinesis 异步触发,不影响 p99 延迟。(3) 规则兜底机制——SageMaker 端点超时/错误时自动降级为 rules-only fallback score,保证可用性。与 风控模型 的模型可解释性和 实时风控引擎 的决策引擎架构关联。→ GitHub

2. realtime-fraud-detection-ml (DiegoTDDD) — Spark Structured Streaming 实时欺诈评分层(XGBoost + foreachBatch + 类不平衡 + PR-AUC 优化)【信号:★★★】

DiegoTDDD/realtime-fraud-detection-ml(0★, Python)是在流式项目之上的独立第二个消费者:离线训练的 XGBoost 分类器通过 Spark Structured Streaming 的 foreachBatch 对同一 Kafka/Redpanda 交易流逐条评分,输出到 Parquet 后在 Streamlit Cloud 展示实时 precision/recall(而非仅交易量)。亮点是类不平衡处理方法论:用 class weights(非重采样)应对 2-7% 欺诈率,以 PR-AUC 为主指标,阈值选择策略为"在 precision floor 约束下最大化跨欺诈类型的 macro-recall"(而非默认 0.5 或聚合 F1)。特征工程做了三轮可证伪迭代,对最难欺诈模式测试了三个方案并记录了两个被否决方案的理由。

风控视角:这个项目的价值在于"诚实的数据科学方法论叙述":(1) PR-AUC 而非 ROC-AUC——在极度不平衡的欺诈检测中,ROC-AUC 会严重高估模型效果(因为 TN 基数巨大),PR-AUC 才是正确的评估指标,这点很多面试题会考。(2) 阈值选择策略——不做"默认 0.5"或"最大化 F1",而是在业务可接受的 precision 下限约束下优化 recall,体现了风控"误杀成本 vs 漏放成本"的权衡。(3) velocity 特量的跨批次状态计算——用 process-local state 在 micro-batch 间维护速度特征,但明确标注了单进程限制。与 特征平台 的实时特征计算和 风控模型 的评估方法论关联。→ GitHub

3. aml-kyt-screening (ai-crypto-onramp) — 加密货币预入金 KYT 合规网关(Go + Chainalysis/TRM + 四级风险分类 + 审计追溯)【信号:★★★】

ai-crypto-onramp/aml-kyt-screening(0★, Go)是加密货币 on-ramp 平台的交易路径上的链上合规门,位于 Transaction Orchestrator saga 的 payment capture 与 MPC signing 之间,在广播前对目标地址做预结算 Know-Your-Transaction 检查。核心能力:(1) 地址风险评分——调用 Chainalysis/TRM Labs vendor SDK 对目标+来源地址评分;(2) 四级暴露分类——sanctioned(OFAC/SDN 匹配)/ high_risk(超阈值)/ unknown(无数据)/ clean;(3) 三态决策——block(制裁命中,saga 中止+补偿)/ manual_review(高风险,进合规队列)/ allow(放行);(4) 地址缓存——带 TTL 的历史暴露缓存避免重复付费调用 vendor。

风控视角:这是"加密货币 AML 从事后追溯到预入金拦截"的完整微服务设计:(1) Saga 中的合规门——KYT 检查嵌入分布式事务 saga,制裁命中时触发补偿事务,体现了"合规即代码"在链上交易中的落地。(2) Vendor 抽象层——ScreenProvider 接口抽象 Chainalysis/TRM,使供应商可替换——这是风控系统对接第三方数据的标准模式。(3) 审计追溯——每次 screening 记录到 Audit/Event Log 供合规取证,满足监管对"可解释决策"的要求。与 反洗钱-AML 的制裁名单筛查和 实时风控引擎 的决策引擎关联。→ GitHub

4. banking-risk-financial-health-platform (divyansh2703) — 银行业务全周期风险分析平台(SQL 数仓 + 三模型 + SHAP + Power BI + 每日预警)【信号:★★★】

divyansh2703/banking-risk-financial-health-platform(0★, Python)是一个端到端银行分析平台,从客户/交易/客服/宏观经济数据预测四种风险信号:客户财务压力、逾期还款风险、流失风险、可疑交易行为。工程亮点:(1) SQL 数据仓库——fact/dimension 表设计,从 raw→interim→processed 的标准数据管道;(2) 三个并行 ML 模型——财务压力预测、欺诈异常检测、流失预测,各自独立训练;(3) SHAP 可解释层——模型预测附带特征贡献解释;(4) 每日高风险客户预警列表——自动化 alert 生成;(5) Power BI 仪表盘——面向风控团队/产品/高管的 stakeholder 视图;(6) Excel 审计工作簿——特征工程公式校验、pivot 分析、评分卡逻辑审查。

风控视角:这个项目展示了"风控不只是模型,而是数据→模型→决策→可视化→审计的完整闭环":(1) 多维风险信号的统一平台——将信用风险(逾期)、欺诈风险(可疑交易)、运营风险(流失)整合到一个数据基础设施中,体现了现代银行风控的"统一风险视图"趋势。(2) Excel 审计工作簿的工程价值——在 SQL+Python+Power BI 技术栈之外保留 Excel 审计层,说明风控团队和审计部门对"可追溯、可手动复核"的刚性需求。(3) 宏观经济数据的引入——将宏观指标作为模型特征,体现了信用风险对经济周期的敏感性。与 信贷风控 的贷后监控和 风控数据架构 的数据管道关联。→ GitHub

5. sba-loan-risk-engine (dhruvbadhe) — SBA 7(a) 信贷风险 Basel II/III 评分引擎(HistGradientBoosting + SHAP + PD×LGD×EAD + Streamlit)【信号:★★★】

dhruvbadhe/sba-loan-risk-engine(1★, Jupyter Notebook)是基于美国小企业管理局 7(a) 贷款 FOIA 数据(1.9M+ 贷款记录)的生产级信贷风险评估引擎。技术栈:HistGradientBoosting(scikit-learn 的梯度提升树)+ SHAP 可解释性 + Basel II/III 预期损失框架(EL = PD × LGD × EAD)+ Streamlit 实时评分仪表盘 + 场景分析。

风控视角:这是 Basel II/III 监管资本框架在开源社区的完整落地参考:(1) PD×LGD×EAD 三参数模型——违约概率(PD)×违约损失率(LGD)×违约风险暴露(EAD)=预期损失,这是银行监管资本计算的核心公式,面试高频考点。(2) HistGradientBoosting vs XGBoost——选择 scikit-learn 原生的 HistGradientBoosting 而非 XGBoost/LightGBM,原生支持缺失值、样本权重,且无需额外依赖,适合信贷数据的常见缺失场景。(3) SHAP 在信贷中的合规价值——监管要求信贷决策可解释,SHAP 的 per-feature 贡献分解满足"拒贷需告知原因"的法规要求。与 信贷风控 的信用评估和 风控模型 的评分卡关联。→ GitHub

6. fingerprintjs — 浏览器指纹开源库(27.9k★,设备识别行业标杆)【信号:★★】

fingerprintjs/fingerprintjs(27915★, TypeScript)是最广泛使用的开源浏览器指纹库,通过 Canvas、WebGL、字体、音频、硬件并发等 30+ 信号生成高唯一性的访客标识符。Apache-2.0/MIT 双许可,活跃维护(921+ commits)。它是设备指纹技术在 Web 端的事实标准,被大量反欺诈、反 bot、账号安全系统作为底层组件使用。

风控视角:设备指纹是反欺诈的基础设施层,理解其原理是风控工程师的基本功:(1) Canvas/WebGL 指纹原理——不同硬件/驱动/浏览器渲染同一图形的像素结果微有差异,可作为设备唯一标识。(2) 指纹在反欺诈中的应用——多账号关联(同一设备注册多账号)、账户盗用检测(设备指纹突变)、bot 检测(无头浏览器指纹异常)。(3) 开源版 vs 商业版差异——开源版准确率约 90%+,商业版 FingerprintJS Pro 通过服务端信号补充可达 99%+,并增加 bot 检测和 VPN/代理识别。与 反欺诈体系 的设备指纹章节和 风控数据架构 的信号采集关联。→ GitHub

7. l4-lp (smucclaw) — L4 业务规则 DSL 引擎(Clojure + SWI-Prolog + 浏览器 IDE + 多语言绑定)【信号:★★】

smucclaw/l4-lp(11★, Clojure)是新加坡管理大学计算法中心的学术级业务规则引擎,为 L4(一种业务规则 DSL)实现了完整的语义和执行管道。核心:(1) 指称语义——将 L4 构成性规则形式化为等式理论,映射为 Prolog 项代数中的 Horn 子句;(2) SWI-Prolog 运行时——基于 Prolog 的规则引擎,通过自定义 Prelude 执行 L4 规范并生成执行 trace;(3) 完全在浏览器中运行——基于 CodeMirror 的 IDE,在客户端 parse/transpile/execute L4 并可视化执行 trace(via guifier);(4) 多语言绑定——Clojure/JVM、ClojureScript/ESM、ClojureScript/Node.js、Python。

风控视角:规则引擎是风控系统的核心组件,L4 展示了"业务规则形式化"的学术深度:(1) DSL→Horn 子句→Prolog 的编译管道——业务规则先编译为逻辑编程的中间表示,再由 Prolog 引擎执行,这种分层设计保证了规则的可验证性和可追溯性。(2) 执行 trace 可视化——每条规则的触发路径可追溯,满足风控审计需求。(3) 与 Drools 的对比——Drools 是工业级 RETE-OO 规则引擎,L4 是学术级逻辑编程规则引擎,两者代表了规则引擎的两种范式(产生式规则 vs 逻辑编程)。与 实时风控引擎 的规则引擎章节关联。→ GitHub

8. lucidfence (adrimg3196) — MDM/UEM 可解释地理围栏风控(本地优先 + Intune/Jamf/Applivery + MCP)【信号:★★】

adrimg3196/lucidfence(2★, Python)是面向 UEM/MDM(统一端点管理)的可解释地理围栏风险引擎。定位是"将设备位置和设备态势转化为地理围栏、路线、可解释风险和 UEM 动作"。工程亮点:(1) 本地优先架构——数据不离开设备(~/Library/Application Support/),不强制云账户;(2) MCP 集成——提供 lucidfence mcp 命令启动本地只读 stdio MCP server;(3) 多 UEM 平台支持——Intune、Jamf、Applivery;(4) macOS 桌面应用——Apple Silicon 原生 DMG,包含后端的自包含应用。

风控视角:这是"风控引擎"从金融交易向企业端点安全的延伸参考:(1) 可解释风险引擎——地理围栏违规的风险评分可解释,而非黑盒判定,满足企业合规需求。(2) 本地优先的隐私设计——位置数据不上传,通过本地推理 + 可选 UEM 连接器实现风控,符合 GDPR/数据本地化趋势。(3) MCP(Model Context Protocol)集成——风控引擎暴露为 MCP server,可被 AI agent 调用读取风险状态——这是"AI agent + 风控引擎"集成的早期实践。→ GitHub

9. FraudMesh (namrathar-18) — 浏览器端实时支付欺诈检测 Demo(图谱环检测 + Louvain + PageRank + SHAP + PSI 漂移)【信号:★★】

namrathar-18/fraudmesh(0★, TypeScript)是一个完全在浏览器中运行的实时支付欺诈检测前端演示,而非生产后端。核心算法是真实的:(1) sub-100ms 评分——浏览器端 LightGBM-style 模型评分;(2) 图谱环检测——用 Louvain 社区发现 + PageRank 识别骡子账户网络(money mule rings);(3) 可解释决策——SHAP 特征贡献展示;(4) 模型监控——PSI(Population Stability Index)漂移检测 + champion/challenger 策略对比。模拟 UPI 交易流,React/Vite/TypeScript 技术栈。

风控视角:虽然这是前端 Demo 而非生产系统,但它完整展示了风控引擎的"决策面"设计模式:(1) Louvain + PageRank 组合检测欺诈团伙——Louvain 发现密集子图(团伙),PageRank 识别高中心性节点(核心骡子账户),两者组合是图反欺诈的经典方法。(2) PSI 漂移监控的前端可视化——PSI 是模型监控的核心指标,衡量特征分布偏移程度,这里做到了实时展示。(3) champion/challenger 在 UI 层的体现——冠军模型 vs 挑战者模型的实时对比,是 A/B 实验在风控中的标准实践。与 反欺诈体系 的图计算章节和 风控模型 的模型监控关联。→ GitHub

10. fraud-detection (ai-crypto-onramp) — 加密货币欺诈评分服务(Feast 特征存储 + XGBoost + SHAP + Kafka + Policy Engine 解耦)【信号:★★】

ai-crypto-onramp/fraud-detection(0★, Python)是 ai-crypto-onramp 平台的欺诈评分微服务,对支付+行为信号做 ML 评分(chargeback/velocity 模型),结果喂给 Policy Engine。技术栈:FastAPI + XGBoost + scikit-learn + SHAP + Feast 特征存储(Redis backend)+ MLflow 模型注册 + Kafka 消费 + PostgreSQL + OpenTelemetry/Prometheus。

风控视角:这个项目的亮点是"特征存储(Feature Store)在风控中的工程实践":(1) Feast 特征存储——Feast 是开源特征存储标准,提供离线/在线特征一致性保证,Redis 作为在线存储实现低延迟特征检索——这是现代风控特征平台的标配组件。(2) 欺诈评分与 Policy Engine 的解耦——fraud-detection 只输出 risk_score,由独立的 Policy Engine 聚合 KYC + AML + Fraud 信号做最终决策,体现了风控系统的"评分层 vs 决策层"分离架构。(3) 与 aml-kyt-screening 的平台关系——两者同属 ai-crypto-onramp 平台,KYT(合规门)+ Fraud(欺诈评分)+ Policy(决策聚合)构成了完整的加密货币风控三件套。与 特征平台 的特征存储和 实时风控引擎 的分层架构关联。→ GitHub


技术趋势

  1. 训练-服务特征一致性工程化:SentinelAI 用共享 Pydantic schema + 特征变换库从代码层面消除 training-serving skew,DiegoTDDD 在 Spark Streaming 中显式标注 feature parity,ai-crypto-onramp/fraud-detection 用 Feast 特征存储统一离线/在线特征——三种不同方案解决同一个经典风控工程问题。
  2. 加密货币风控平台化:ai-crypto-onramp 同一组织同时维护 aml-kyt-screening(KYT 合规门)和 fraud-detection(欺诈评分),通过 Policy Engine 聚合,展示了链上风控的"合规+欺诈+决策"三件套解耦架构。
  3. 可解释性异步化成为标配:SentinelAI 将 SHAP + Bedrock GenAI 摘要移到支付路径外的异步解释服务,不阻塞实时决策——"实时只评分,解释异步生成"正在成为生产级风控系统的标准架构。
  4. 类不平衡处理的诚实方法论:DiegoTDDD 用 class weights(非重采样)+ PR-AUC 主指标 + precision-floor 约束下的 macro-recall 阈值选择,并记录三轮特征工程的失败方案——是面试级的数据科学方法论参考。

行业案例

值得深入