风控日报 — 2026-08-14

📊 原料:46 条相关条目(GitHub 仓库搜索 50 条 / arXiv 10 条全部无关——新批次 2608.122xx-2608.123xx(08-12 提交日期):量子临界性纠缠见证、Image-to-Video 智能体优化、银河磁场 CHANG-ES、Agentic 视频自编码器 AVA-Encoder、强到弱测试时能力迁移、稀疏安全离线 RL 代价推断、Bengali 低资源语言 AI 基础设施、Fourier 长度四指标猜想、min-plus 二叉树有限深度标度、skew Schur 多项式 Lorentzian)/ HN 15 条和 Trending 20 条经去重后无风控相关条目入选)。arXiv 全噪声小计:07-16 打破的连续 24 期 100% 噪声记录后又连续 21 期(07-17、07-19、07-20、07-21、07-22、07-23、07-24、07-26、07-27、07-28、07-29、08-04、08-05、08-07、08-08、08-09、08-10、08-11、08-12、08-13、08-14)全噪声,累计 642 条中 1 条相关,噪声率 99.8%。~18 条已在近 1-2 期日报中覆盖或剔除(qiuweiyu/antifraud-knowledgehub [08-12]、Khairiya2/fraud-detection-notitification-system [08-13]、TheAlchemistNerd/PesaLink-Fraud-Detection-Overview [08-13]、adrimg3196/lucidfence [08-07]、vridhib/obligation-net-optimizer [08-04]、matrixarkai/TemporalStore [非金融风控]、phase-rs/phase [游戏规则引擎]、ShawnKimble/aiia-demo [08-12]、sohamvjadhav/Mule-Hunt [08-07]、disposable-email-domains / ip-fraud-database [数据库]、Oz134/perishable-inventory-risk-engine [非金融风控]、FFraud-com 系列 [数据库]、eramitgupta/disposable-email [数据库]、meghana2711/RealTime_End2End_Finance_Dashboard [股票非风控]、punamshihare8-art/AMLIS-Assignment-5 [学生作业]、gabrielle-git/pe-atras [教育工具]、sanjeetsheoran/FinGuard-AI [空仓路线图]、ChiragKumargithub/Payguard-Ai [空仓路线图])。⚠️ 恶意仓库持续残留:Amy7007/VPN-Detector(07-26 已确认)、yoelpa6680/upi-fraud-gnn(07-26 已确认)、heydsqi-dsq/cross-border-fraud-detection(07-26 已确认)、primatewakeisland574/payment-channel-guide(08-09 已确认)本轮仍在搜索结果中,不重复验证。今日筛出 8 条新增高信号条目,覆盖 14 源 OSINT 企业关系图谱、联邦学习+FHE+GNN 跨行欺诈平台、外贸 B2B 背调 Agent、IEEE-CIS 特征泄露量化分析、成本敏感欺诈风险引擎、XGBoost 欺诈检测指挥中心、CDC/流式银行数据摄入架构、文档欺诈检测。今日核心亮点是 CF-Intelligence——一个隐私保护的跨行联邦欺诈检测+AML 平台,融合联邦学习+差分隐私+全同态加密+GraphSAGE+拜占庭防御,12.6MB 代码 + 875 测试 + 实时部署 + EU AI Act 合规映射,是迄今为止最完整的跨机构协作风控架构实现。

今日高信号

1. CF-Intelligence (yusufcalisir) — 隐私保护跨行联邦欺诈检测 & AML 平台(联邦学习 FedAvg/FedProx/Krum + Opacus 差分隐私 + TenSEAL CKKS 全同态加密 + GraphSAGE 图神经网络 + Fuzzy PSI 身份解析 + 9 信号复合风险引擎 + 拜占庭防御 + 875 测试 + Vercel 实时部署 + EU AI Act 合规映射)【信号:★★★】

yusufcalisir/CF-Intelligence(0★, Python 3.12 + FastAPI + PyTorch 2.4 + TenSEAL + Opacus, MIT, CI badge, 12.6MB, 875/875 测试通过, Vercel live demo)是一个隐私保护的跨银行协作欺诈检测和反洗钱平台——解决金融机构因 GDPR Article 6/17、CCCPA、银行保密法等法律约束无法集中原始交易数据的"数据孤岛"问题,通过联邦学习让多家银行在不暴露原始数据的前提下协作训练全球欺诈检测模型。

核心威胁场景:(1) 跨行速度和分层辛迪加——洗钱集团在数秒内将非法资金在多个银行节点间顺序转移,在任何单行规则引擎检测到速度异常前清算;(2) 结构化分拆网络——犯罪网络将大额现金存款分散到多个金融机构的微交易中,严格低于单行 $10,000 USD 报告阈值。

隐私增强技术栈(PETs)

技术 作用
差分隐私 Opacus (L2 范数裁剪 C, 噪声 σ) 梯度级隐私保护
安全聚合 Diffie-Hellman SecAgg 掩码 零和向量扰动
全同态加密 TenSEAL Microsoft SEAL CKKS 多项式环密文加密
硬件 TEE Intel SGX / AWS Nitro 远程证明 可信执行环境密封

拜占庭防御:FedAvg / FedProx / Krum / Trimmed Mean / Median / Bulyan 六种鲁棒聚合器 + SVD 频谱后门触发检测 + 毒化隔离日志。

图神经网络:流式 GraphSAGE + Fuzzy PSI 身份解析,跨行构建交易图谱检测多跳洗钱拓扑。

9 信号复合风险引擎 + Optuna 贝叶斯 TPE 调参 + Non-IID Dirichlet 分区器 + 金丝雀质量门禁(holdout 评估 → 冠军推广/自动回滚)。

风控视角:跨机构协作风控的最完整隐私保护架构实现:(1) 联邦学习解决跨行数据孤岛——GDPR/银行保密法禁止集中原始交易数据,但跨行洗钱和分拆网络需要跨机构视角——联邦 GNN + DP + FHE 是技术上的理想解决方案。与 08-13 PesaLink 的概念架构(仅文档)形成对比,CF-Intelligence 有完整实现。(2) 拜占庭防御的对抗鲁棒性——Krum/Trimmed Mean/Bulyan 防御恶意参与方的模型投毒——联邦风控中不可信参与方是真实威胁。(3) 9 信号复合风险引擎 + 可解释性——SHAP/LIME + reason codes——可解释风控的工业实现。(4) Fuzzy PSI 跨行身份解析——在不暴露 PII 的前提下跨行关联实体——跨行图谱构建的隐私保护基石。与 反洗钱-AML的联邦学习和跨行协作、风控模型的 GNN 和联邦学习、反欺诈体系的隐私保护技术关联。→ GitHub · Live Demo

2. Paper Trail (bennett-17) — Stdlib Go OSINT 企业实体关系图谱工具(14 个独立公共数据源 × 4 国覆盖 + SEC EDGAR + OFAC/UK 制裁名单 + UK Companies House PSC + IRS Form 990 非营利组织 + Certificate Transparency + 联邦诉讼 RECAP + LittleSis 人脉 + 19 命令统一 JSON 输出 + 关系图谱节点/边 + CI)【信号:★★★】

bennett-17/paper-trail(1★, Go 1.22+ stdlib-only, MIT, CI badge)是一个开源 OSINT 工具,用于通过公共财务申报映射企业实体关系——给定公司名或 ticker,从 14 个独立公共数据源中交叉引用 SEC EDGAR、多国公司/慈善注册、制裁名单、Certificate Transparency 日志和联邦诉讼记录,以发现壳公司和关联风险信号。

14 源覆盖表

命令 数据源 覆盖
lookup/filings/graph/fulltext SEC EDGAR 美国上市公司 + 内部人关系 + 全文搜索
nonprofit IRS Form 990 (via ProPublica) 美国 501(c) 非营利组织
aucharity/ukcharity ACNC / Charity Commission 澳大利亚/英国慈善机构
sanctions/uksanctions US Consolidated Screening List / OFSI OFAC SDN + 国务院/BIS 限制方 + 英国金融制裁
companieshouse/person/nzbn UK Companies House / NZ BN 英国/新西兰公司高管+董事+受益所有人(PSC)
crtsh Certificate Transparency logs 域名签发的 TLS 证书(全球)
courtlistener CourtListener (RECAP) 联邦 PACER 诉讼参与方
littlesis/openfec/usaspending/gazette LittleSis / FEC / USAspending / Gazette 人脉/政治捐款/联邦合同/破产公告
risk 以上全部组合 跨源结构化红旗信号

工程特征:(1) Stdlib-only Go——零第三方依赖,go build 无需 go mod download;(2) 每个命令是对政府/政府附属 API 的实时查询——无爬虫、无批量下载;(3) 统一 --json 输出 + 节点/边关系图谱。

风控视角:企业尽调和制裁筛查的多源融合 OSINT 工具:(1) 14 源 × 4 国的制裁和实体核查覆盖——从单一公司名/ticker 出发,交叉验证 EDGAR 申报、制裁名单、诉讼记录、慈善注册——企业级 KYC/AML 尽调的开源基础设施。(2) OFAC SDN + UK OFSI 双制裁体系——同时覆盖美国和英国制裁名单——跨国合规的基础。(3) 关系图谱的节点/边输出——实体关系的结构化输出,可直接接入图分析/GNN 管道——与 08-12 GNN-SimMule 的图建模互补,Paper Trail 提供实体关系的原始数据。(4) PSC 受益所有人查询——UK Companies House 的 persons with significant control 数据——反洗钱的核心:穿透壳公司到最终受益人。与 反洗钱-AML的制裁筛查和受益所有人、风控策略的实体关系图谱关联。→ GitHub

3. OSINT Agent (wo9230) — 外贸 B2B 客户背调 & 供应商风险核查 Agent(Claude Code + MCP + 15+ 调查类型 + 🔴🟡🟢 三级风险评级 + 域名注册年龄/地址匹配/制裁名单/数字足迹比对 + HTML 专业尽调报告 + 亚马逊卖家背调 + 竞品情报)【信号:★★】

wo9230/osint-agent(8★, Python + Claude Code + MCP, 无 license)是一个面向外贸 B2B 场景的开源 OSINT 商业情报系统——用公开数据(OSINT)把信息盲区补上:签合同、发样品、走信用证之前,15 分钟给对方做一次背景核查,拿到包含公司背景、财务分析、供应链溯源、决策人画像、风险评级的专业 HTML 报告。

15+ 调查类型

命令 输出
/osint <company> company 公司全维度调查(工商+财务+供应链+脉络)
/osint <name> person 决策人个人画像(LinkedIn+社媒+职业轨迹)
/osint <factory> supplier 国内供应商风险评估
/osint <brand> competitor 竞品情报(弱点矩阵+BCG+供应链)
/osint <ASIN> amazon-seller 亚马逊卖家背调
/osint <industry> industry 行业快扫(规模+格局+五力+PESTEL)
/osint <entity> quick-id 2 分钟快速身份识别

核心风险信号(自动标红 🔴/🟡/🟢):域名注册 30 天的新公司、登记地址与实际经营不符、制裁名单命中、自称规模与数字足迹严重不匹配。

风控视角:中文 B2B 场景的自动化尽调 Agent:(1) 外贸反诈骗的 OSINT 自动化——将传统手工尽调(企查查+天眼查+海关数据+社媒搜索)自动化为一条命令的 Agent 工作流——B2B 反欺诈的效率提升。(2) 🔴🟡🟢 三级风险评级——结构化风险信号输出而非原始数据——决策支持的实用设计。(3) Claude Code + MCP 的 Agent 架构——基于 Anthropic CLI 的 Agent 工具调用——风控场景中 AI Agent 的实际应用(与 08-12 FraudLens AI 的确定性+LLM 混合架构形成对比——osint-agent 是纯 LLM 驱动)。(4) ⚠️ 依赖付费 Claude Code 订阅 + 多个 API Key——不是自托管方案。与 反欺诈体系的 B2B 反诈和尽调、风控技术地图的 Agent 架构关联。→ GitHub

4. IEEE-CIS Fraud ML Decision Trail (aghasalim) — IEEE-CIS 欺诈检测特征泄露量化分析(特征泄露 > 分割泄露 4.4× + 全局 target encoding = +0.2723 AUC 虚高 + 时间排序分割仍被全局聚合欺骗 + 2×2 实验设计 + CI + 合成数据 + 决策追踪非排行榜分数)【信号:★★】

aghasalim/ieee-fraud-ml(0★, Python 3.12, MIT, CI badge, 三年级应用计算机 AI 学生项目)是一个IEEE-CIS 欺诈检测端到端项目——核心定位:产出是可审计的决策追踪(NOTES.md),不是排行榜分数

核心发现——特征泄露量化(60,000 合成行,4,000 重复卡,4.0% 正例率):

分割 target encoding AUC 是否训练了未来数据?
shuffled K-fold global 0.8975
shuffled K-fold fold-local 0.6779
chronological global 0.8889
chronological fold-local 0.6166

只有最后一行是可辩护的。最佳外观到诚实是 +0.2809 AUC

隔离分析

泄露源 隔离效应
全局 target encoding(分割正确) +0.2723
shuffled 分割(编码正确) +0.0613

特征泄露是分割泄露的 ~4.4 倍。最危险的失败是第三行:正确的时序分割 + 全局聚合 target encoding = 0.8889——你已经做了人们讨论的那件事,所以你停止了检查,但偏差 0.27。

诚实定位:竞赛数据尚未下载(需要 Kaggle API token + 规则接受)。目前构建并测试的是验证方法论 + 合成数据上的一个真实实验。

风控视角:特征泄露量化对生产欺诈检测的警示:(1) 特征泄露 > 分割泄露的发现——全局 target encoding 的 +0.2723 AUC 虚高远超 shuffled 分割的 +0.0613——这意味着即使你做对了时序分割,全局聚合特征仍会严重虚高模型指标。与 08-13 HarshaSanka 的密封测试边界 + 泄漏安全特征工程、08-11 payment-fraud-ml 的 CI 数据泄露检查形成防泄露工程纪律光谱。(2) "正确的事+隐藏的错=最危险的失败"——时序分割正确但 target encoding 全局计算——你已经做了被讨论的那件事所以停止检查——这种"已知正确步骤中的隐藏错误"是生产欺诈模型最危险的泄露模式。(3) 2×2 实验设计 vs 单一 before/after——单一对比会读 "0.8975 vs 0.6166" 并错误归因于分割——2×2 分离了两个泄露源的独立效应——实验设计的风控参考。(4) 决策追踪而非排行榜分数——这是值得推广的 ML 工程态度。与 风控模型的防泄露和数据验证关联。→ GitHub

5. Financial Fraud Risk Engine (don8891) — 成本敏感欺诈风险引擎(成本敏感阈值搜索 + SHAP 可解释性 + reason codes + 阈值策略产物 + Streamlit 仪表盘 + 批量评分 + scikit-learn 管道 + Brier 分数 + 合成数据生成器 + CI)【信号:★★】

don8891/online-payment-fraud-detection(0★, Python 3.10+ + scikit-learn + SHAP + Streamlit, 无 license, CI badge, 2.4MB, ⚠️ portfolio/research demo, 合成数据)是一个面向生产的欺诈风险工作流——核心定位:将欺诈模型从"notebook 上的指标"转化为决策支持系统:成本敏感评估、阈值策略产物、批量分诊、仪表盘审核、SHAP 可解释性和分析师友好的 reason codes。

核心工程特征:(1) 成本敏感阈值搜索——不是默认 0.5 概率阈值,而是搜索最小化(误报成本 + 遗漏欺诈成本)的最优阈值;(2) 阈值策略产物——阈值不是硬编码而是生成为分析师可审核的策略文件;(3) reason codes——每个风险判定附带可解释原因列表;(4) Brier 分数——模型校准评估(不仅是排序能力);(5) 合成数据生成器——包含重叠和标签噪声的更难合成数据集。

管道:合成数据生成 → 特征准备 → scikit-learn 管道训练 → ROC-AUC/PR-AUC/Brier/分类指标评估 → 简单基线对比 → 成本敏感阈值搜索 → 阈值策略产物 → 批量评分 → Streamlit 仪表盘审核 → SHAP 可解释性。

⚠️ 描述修正:仓库描述称 don8891 为仓库所有者,但 CI badge 指向 AmirhosseinHonardoust/Financial-Fraud-Risk-Engine——don8891 可能是 fork 或改名后的仓库。README 标题是"Financial Fraud Risk Engine"。

风控视角:欺诈风险模型从指标到决策支持的转化:(1) 成本敏感阈值搜索的决策化设计——阈值不是概率截断而是(误报成本 + 遗漏欺诈成本)最小化——与 08-13 HarshaSanka 的成本矩阵策略选择(APPROVE/REVIEW/BLOCK)形成对比:HarshaSanka 用 6 月推广窗口模拟成本选冠军模型,don8891 用成本函数搜索决策阈值。(2) 阈值策略产物的可审核性——阈值生成为分析师可审核的策略文件——决策可追溯可审计。(3) Brier 分数的校准意识——不仅是 AUC 排序能力,还评估概率校准——与 08-13 HarshaSanka 的 Isotonic 校准(Brier 0.000848)一致。(4) ⚠️ 合成数据 demo,但成本敏感阈值 + reason codes + 策略产物的决策支持设计有工程参考价值。与 风控策略的阈值优化和决策化、风控模型的可解释性关联。→ GitHub

6. REDWING Fraud OS (tshriraj-del) — 统一 AI 欺诈检测指挥中心(React + FastAPI + XGBoost + 914K 交易 + OOT AUC 0.941 + 自我改进规则引擎 + 网络图谱欺诈环检测)【信号:★★】

tshriraj-del/redwing-fraud-os(0★, JavaScript/React + Python/FastAPI + XGBoost, 无 license, 495KB)是一个统一 AI 欺诈检测指挥中心——React 前端 + FastAPI 后端 + XGBoost 模型,在 914,065 交易上达到 Out-of-time AUC 0.941,包含自我改进的规则引擎和网络图谱欺诈环检测功能。

核心特征:(1) 914K 交易 + Out-of-time AUC 0.941——XGBoost 在大规模交易集上的检测性能;(2) 自我改进规则引擎——规则不是静态的,而是根据反馈持续优化;(3) 网络图谱欺诈环检测——将交易建模为网络图谱,检测协调欺诈环——超越逐笔交易的规则视角。

⚠️ 描述修正:GitHub 仓库描述字段声称"880K transactions, AUC 0.979",但 README 实际数字为 914,065 交易, Out-of-time AUC 0.941——描述字段的数字被夸大(AUC 从 0.979 降至 0.941)。

风控视角:规则引擎 + ML + 图谱三合一的指挥中心设计:(1) 规则引擎 + ML 组合——XGBoost 模型 + 规则引擎的双层检测——与 08-12 SentinelPay 的规则分+ML 概率组合评分理念一致。(2) 网络图谱欺诈环检测——超越逐笔交易的协调欺诈检测——与 08-12 GNN-SimMule 的 muleRing 检测在概念上互补。(3) React 指挥中心——运营分析师的统一界面——欺诈检测的运营化设计。(4) ⚠️ 495KB 仓库较小,README 在 main 和 master 分支均返回 HTML(可能为非默认分支或私有 README),工程深度待进一步验证。与 实时风控引擎的指挥中心和 反欺诈体系的规则+ML混合关联。→ GitHub

7. Banking Fraud Data Ingestor (dscalexandre) — 银行欺诈检测数据摄入架构(Batch + CDC + Streaming 三流摄入 + Debezium + Kafka/Kafka Connect + Confluent Cloud + S3 + Terraform IaC + Poetry + GitHub Actions CI/CD + 解决方案架构文档 + 职责分离设计)【信号:★★】

dscalexandre/banking-fraud-data-ingestor(0★, Python 3.12 + Poetry + PostgreSQL + Debezium + Kafka + Kafka Connect + Confluent Cloud + AWS Lambda + S3 + Docker + Terraform, 无 license)是一个银行欺诈检测平台的第一模块——负责 batch、CDC(变更数据捕获)和流式数据摄入,最终交付到 Amazon S3 或 Confluent Cloud 管理的 Apache Kafka。

架构设计——清晰的职责分离:应用配置 / 基础设施 / 应用代码 / IaC / 数据合同 / 可观测性 / 安全 / CI/CD 自动化——每个摄入流程可独立演进、维护和运营。

技术栈:Python + Poetry(包管理)+ PostgreSQL + Debezium(CDC)+ Apache Kafka + Kafka Connect + Confluent Cloud + AWS Lambda + Amazon S3 + Docker + Terraform(IaC)+ GitHub Actions(CI/CD)。

项目状态:第一个生产增量(countries 流)的准备工作就绪——治理、参考架构、CI 和本地环境已建立;生产基础设施尚未在此阶段配置。

风控视角:欺诈检测数据摄入层的工程纪律参考:(1) Batch + CDC + Streaming 三流摄入——三种数据摄入模式覆盖不同的欺诈检测延迟需求:batch(离线模型训练)+ CDC(准实时增量同步)+ streaming(实时检测)——与 08-12 Banoth281 Lakehouse 的 Redpanda/Kafka 流式摄入互补,dscalexandre 增加了 CDC 维度。(2) Debezium CDC 的变更数据捕获——从 PostgreSQL binlog 实时捕获变更——欺诈检测中"账户信息变更"(地址、电话)是 ATO 的重要信号。(3) Terraform IaC + GitHub Actions CI/CD——基础设施即代码 + 自动化流水线——工程纪律的基础。(4) ⚠️ 项目处于早期阶段(首个功能增量准备中),但 Batch+CDC+Streaming 三流摄入 + 职责分离的架构设计对欺诈检测数据管道有参考价值。与 实时风控引擎的数据摄入和 风控技术地图的数据工程关联。→ GitHub

8. VICTIG Document Fraud Detector (lamangamatt) — 文档欺诈检测工具(元数据分析 + 数学验证 + 创建工具检测 + 视觉一致性检查 + Claude AI 深度分析 + 工资单/W-2/1099/IRS Transcript/学历证 + 批量跨页追踪号交叉检查 + Streamlit)【信号:★】

lamangamatt/victig-fraud-detector(0★, Python + Streamlit + Tesseract OCR + Claude AI, 无 license)是一个就业验证文档欺诈检测 Web 工具——分析文档中的欺诈迹象,支持工资单、W-2 表格、1099 表格、IRS 工资与收入转录、录用通知、文凭/成绩单。

欺诈检测逻辑

检测类型 方法
元数据分析 PDF 创建日期、软件、修改历史
数学验证 工资单计算验证(毛收入 - 扣除 = 净收入)
创建工具检测 标记 Photoshop/Canva/AI 工具创建的文档
视觉一致性 文档结构基础一致性检查
AI 分析 可选 Claude 深度分析
IRS Transcript 批量模式 跨页追踪号交叉检查——检测复制粘贴的转录头部

实战背景:IRS Transcript 批量模式基于 2026-07-07 一个 Myssy Clayson 伪造样本添加。

风控视角:就业验证文档欺诈的实用检测工具:(1) 创建工具检测(Photoshop/Canva/AI)——标记文档编辑工具的元数据残留——文档欺诈的基础信号。(2) IRS Transcript 跨页追踪号交叉检查——批量模式下检测复制粘贴的转录头部——基于真实伪造样本的迭代改进——实战驱动的检测逻辑。(3) 数学验证(毛-扣除=净)——工资单计算的数学一致性检查——简单但有效的欺诈检测维度。(4) ⚠️ Streamlit 单文件应用 + Tesseract OCR,适合小团队(30 用户)部署——就业验证场景的实用工具。与 反欺诈体系的文档欺诈和身份验证关联。→ GitHub


技术趋势

行业案例

值得深入

  1. CF-Intelligence 的联邦学习 + PETs 完整实现——联邦 GNN + DP + FHE + SecAgg + TEE + 拜占庭防御的完整技术栈——这种跨机构隐私保护架构如何应用到国内的银联跨行风控场景?Fuzzy PSI 跨行身份解析在不暴露 PII 的前提下关联实体的工程实现是否值得借鉴?
  2. aghasalim 的特征泄露 4.4× 分割泄露的量化发现——全局 target encoding 在正确时序分割下仍虚高 0.27 AUC——这种"已知正确步骤中的隐藏错误"如何系统性地检测?我们的特征工程管道中是否存在类似的全局聚合泄露?
  3. Paper Trail 的 14 源 × 4 国 OSINT 融合——从单一公司名出发交叉验证 SEC EDGAR + 制裁名单 + 诉讼记录 + PSC——这种多源融合的实体关系图谱输出如何与我们的 KYC/AML 尽调流程整合?