风控日报 — 2026-08-18
📊 原料:45 条相关条目(GitHub 仓库搜索 37 条 / arXiv 8 条全部无关——新批次2608.145xx(08-14 提交日期):IceCube 暗物质、年轻星团宇宙线、JWST Lyα 小红点、分布值结果生成驱动推断、史前手印性别深度学习、ICL 会话交接、4K 图像修复、有限群混合恒等式——全部与风控无关)/ HN 19 条和 Trending 20 条经去重后无风控相关条目入选)。arXiv 全噪声小计:连续 24 期(07-17→08-18,跳过 07-25、08-16 及其他无调度日)全噪声,累计 672 条中 1 条相关,噪声率 99.9%。~20 条已覆盖或剔除(robson/sentinel-upi/gs-risk-engine/ecommerce-pipeline [均 08-17]、lucidfence [08-07]、antifraud-knowledgehub [08-12]、marketplace-phaas-tracker [08-15]、disposable-email-detector [08-11]、graph-fraud-ai [08-13]、Payguard-Ai [08-14 空仓]、obligation-net-optimizer/perishable-inventory/SupplyChain-Risk-Engine/TemporalStore/FFraud-com ×2/eramitgupta [非风控或数据库]、policyengine-us [税务规则引擎]、medtech-classifier [EU MDR]、sushilpatil51p-ds [08-10]、anshikamogha18 [验证确认:空仓库,Spring Boot/Kafka/Angular 描述纯属愿景]、sre-copilot [验证 LEGIT 但为 SRE 告警分诊非风控])。🚨 新确认恶意仓库 1 个(新变体:伪造反病毒验证页 + 活载荷自动下载)——tomkibjgray5429/fincrimeradar-aml-review:README 徽章 CTA → github.io 落地页index.html(base64+XOR 0xCF 混淆)伪造杀毒扫描(Roblox 作弊 DLL 假文件列表 → "No Threats Detected" → ✔ Virus Free 徽章),setTimeout 1.5s 自动下载密码保护Loader_v3.5.zip(Password: 2026,防 AV 扫描),载荷托管于一次性 release-only 仓库leon-gray9/kernel-space-i5wnqq(自述 "Official distribution channel")。165 commits/2 周 bot farming(improve-build-59731模式化消息)+.github/update-logcron 痕迹。首次验证到活载荷(HTTP 302 → release CDN)。生成式账号家族第 3 例(primatewakeisland574 / paulineconsuming416 / tomkibjgray5429)。累计已确认 18 个恶意仓库。持续残留 6 个不重复验证:defi-risk-screening(07-26)、VPN-Detector(07-26)、payment-channel-guide(08-09)、upi-fraud-gnn(07-26)、aml-checker-pro-master(07-29)、payment-fraud-detector(07-26)。今日筛出 7 条新增高信号条目。今日核心亮点是 osprey——Go 单二进制 AML 交易监控引擎,CEL 规则表达式 + FATF typology 加权组合评分,"60 秒部署";以及 fraud-detection-mlops 的测量纪律(seed-noise bands + 特征契约审计 205/502 诚实申报 + PIT SQL 强制执行),把防泄露纪律光谱推进到第 4 步。
今日高信号
1. osprey (opensource-finance) — Go 单二进制 AML 交易监控引擎(CEL 规则表达式 + FATF typology 加权组合评分 + structuring/round-amount/account-drain 内置规则 + detection/compliance 双模式 + open-core 社区版 SQLite / pro 版 Postgres/Redis/NATS + goreleaser/k6/OpenAPI)【信号:★★★】
opensource-finance/osprey(0★, Go, Apache-2.0, 138 树条目 / 59 Go 文件 cmd/osprey + internal/{api,bus,cache,domain,repository,rules}, 24 commits 2026-01-08→08-17 持续 7.5 个月, 英国组织 opensource.finance 2026-01 创建)是一个"60 秒部署"的交易监控(transaction monitoring)引擎——描述与实现完全相符,非 vaporware:真实编译产物、goreleaser 发布流水线、k6 负载测试、25KB OpenAPI 规范、CI + sandbox-assurance workflow。
规则引擎(CEL 表达式路线):configs/rules/fatf-rules.json 内置可读规则示例——
structuring-001:amount >= 9000.0 && amount < 10000.0(FATF Rec 20 结构性拆分)round-amount-001:amount == double(int(amount / 1000.0)) * 1000.0(整千金额)account-drain-001:old_balance > 0.0 && new_balance == 0.0(账户清空)velocity_count > 5(速度规则)
Typology 层:configs/typologies/fatf-typologies.json 把规则组合为 FATF 类型学——Structuring/Smurfing、Account Takeover、Mule Account、Rapid Movement of Funds——带权重的规则组合 + alertThresholds,是行业 alert scoping 逻辑的开源化。双运行模式(detection / compliance)。
风控视角:AML 规则引擎表达层的新路线样本:(1) CEL 表达式规则 vs 08-09 fraud-engine 的"规则即 DB 行 + 解释执行"——两条路线收敛于同一目标:可审计、可版本化、非改代码热更规则;CEL 是 CNCF 生态标准表达式语言,风控规则 DSL 选型时值得对比。(2) typology = 规则加权组合 + 告警阈值——把"多条弱规则组合成强信号"的 scoping 逻辑做成了配置层,这是 AML 交易监控系统的核心骨架开源化。(3) 单二进制 + SQLite 社区版降低中小机构 AML 监控部署门槛。⚠️ open-core 模式(pro 层闭源)、0★、年轻组织,生产采用前需自评估。与 风控策略 的规则引擎和 反欺诈体系 的 AML 监控关联。→ GitHub
2. fraud-detection-mlops (jjabuk) — IEEE-CIS 欺诈 MLOps 测量纪律标杆(Dagster/BigQuery/LightGBM/Vertex AI + seed-noise bands 指标方差带 + 特征契约审计 205/502 列诚实申报 + PIT SQL 强制执行 + Dagster promotion gate + 51 问题驱动 EDA)【信号:★★★】
jjabuk/fraud-detection-mlops(0★, Python, MIT, 228 树条目 / 146 代码文件, 19 commits 08-16→08-17 两天密集但 commit 内容真实(test: build the ingestion fixture instead of reading uncommitted data)——诚实 burst 非 farming)是本批ML 工程严谨度最高的仓库,在 IEEE-CIS 数据集上实现 GCP 全链路(Dagster 编排 / BigQuery / LightGBM / Vertex AI)。
三个可迁移的测量纪律:(1) seed-noise bands——同一 pipeline 用多个随机种子跑出指标方差带,任何"提升"必须超出噪声带才算真实提升(模型选型的统计学纪律,开源欺诈项目里首次见到);(2) 特征契约审计——诚实申报 502 列中只有 205 列通过契约检查,把特征质量摆到台面;(3) point-in-time SQL 强制执行——特征查询在 SQL 层强制 PIT 语义,不依赖开发者自觉。
风控视角:防泄露纪律光谱推进到第 4 步:08-13 HarshaSanka 密封测试边界 → 08-14 aghasalim 特征泄露 4.4× 量化 → 08-17 sentinel PIT 可运行测试 → 今日 PIT SQL 强制 + 特征契约审计 + seed-noise bands——从"方法论论述"到"CI 门禁"再到"SQL 层强制 + 统计学验收"。(1) seed-noise band 应纳入模型验收标准——多数离线实验的 0.1% 级"提升"根本在种子噪声带内。(2) 特征契约审计(哪些列可用/不可用/为什么)是特征平台治理的直接素材。⚠️ 两天新建,未经生产验证,读方法论不抄架构。与 风控模型 的评估纪律和 实时风控引擎 的特征平台关联。→ GitHub
3. fraud-detection-engine (NithinBobbili) — Kafka + PySpark Structured Streaming 流式规则+IsolationForest 混合引擎(真实测试文件 + CI + docker-compose + 诚实合成基准 P 62.4%/R 80.6% vs 0% naive 基线)【信号:★★】
NithinBobbili/fraud-detection-engine(0★, Python, 27 树条目 / 12 py 文件含 src/features.py/streaming_processor.py + 4 个测试文件, 1 commit 2026-08-17 当天创建, requirements + CI + docker-compose)是一个流式欺诈检测最小可测实现——Kafka + PySpark Structured Streaming + 规则引擎 + IsolationForest 混合。
诚实基准文化:README 报告实测 P 62.4% / R 80.6%,并显式对比 0% 召回的 naive 基线(证明召回来自引擎而非类别分布);标签列命名为 is_fraud_synthetic_label,主动声明数据为合成。
风控视角:规则+异常检测混合的流式参考实现:(1) 规则层(可解释、快速路径)+ IsolationForest(无监督、捕获规则外模式)的双层结构与 08-17 PayShield 三层、08-17 DPFRIS 80/10/10 加权同属"混合架构"设计空间。(2) naive 基线对比是小数据集上防自欺的低成本手段——比单纯报指标可信得多。(3) ⚠️ 单 commit 当天新建,unproven,参考结构不参考成熟度。与 实时风控引擎 的流式架构关联。→ GitHub
4. GraphNN-Fraud-Ring-Detection (piyushlabde) — 欺诈环调查叙事式可视化(FastAPI+NetworkX 后端预留 PyG 模型插槽 + React/Vite/Three.js instanced WebGL 大图渲染 + 滚动驱动调查叙事 + 全合成数据诚实声明)【信号:★★】
piyushlabde/GraphNN-Fraud-Ring-Detection(0★, TypeScript + Python, 86 树条目 / 54 代码文件, 5 commits 全部 08-17, Vercel 部署配置)是一个全栈欺诈环可视化 demo——注意它自称 GraphNet 但不是检测器:README 开篇即声明 "Every number in this app is synthetic",PyG 只是预留的 plug-in 插槽。
值得看的是调查 UI 工程:(1) instanced WebGL 渲染(Three.js)——大规模图渲染的前端工程方案,比默认 D3 力导向图能处理的节点数高一个量级;(2) scroll-driven storytelling——滚动驱动的叙事式调查引导,把"从一个可疑节点出发展开资金环"做成有剧本的调查体验——欺诈调查工具的 UI 形态创新;(3) 后端 FastAPI + NetworkX,换真实 PyG 模型不需要动前端。
风控视角:图风控的"最后一公里"是调查员 UI:检测出欺诈环(GNN/社区发现)之后,如何让调查员高效理解并展开证据链,是图风控落地最常被忽视的环节。(1) 叙事式调查引导适合案件复盘和培训场景。(2) instanced WebGL 方案对自研图调查平台的渲染选型有直接参考价值。⚠️ 全合成演示,无检测能力。与 反欺诈体系 的调查工作流关联。→ GitHub
5. GNN-fraud-detection (HariniReddy0627) — 时序 GraphSAGE 欺诈排序 POC(PaySim + train_gnn/temporal_train/graph_builder 分层 + streaming 场景时序图特征)【信号:★】
HariniReddy0627/GNN-fraud-detection(0★, Python, 20 树条目 / 11 py 文件(train_gnn.py/temporal_train.py/graph_builder.py), 4 commits 全部 08-17, README 有 Notion/AI 导出的转义痕迹)是 temporal GraphSAGE 在 PaySim 上的欺诈排序 POC——验证 LEGIT、结构清晰但 portfolio 级深度。
风控视角:时序 GNN 的入门参考:流式欺诈检测中"边按时间到达、历史邻域随窗口演化"的时序图建模(temporal sampling),是静态 GNN 走向 streaming 场景的关键一步;与 08-07 graph-fraud-ai 的静态四模型对比、08-17 PayShield 的异构图形成互补。⚠️ POC 深度有限,作概念地图非工程参考。与 风控模型 的 GNN 关联。→ GitHub
6. paysim-fraud-network-analysis (victorhugo-ml) — 轻量图 EDA 工具链(DuckDB → pandas → NetworkX 有向交易图 + 1,000 笔结构化抽样 PaySim 子集 + Gephi 导出 + notebook 验证 CI,葡语)【信号:★】
victorhugo-ml/paysim-fraud-network-analysis(0★, Jupyter, 1 个已执行 notebook + scripts/validate_notebook.py + requirements + CI, 2 commits 08-17, 葡语 README)是调查员级的低成本图分析路径——DuckDB SQL 做图统计、NetworkX 建有向交易图、Gephi 出可视化。
结构化抽样值得注意:从 PaySim 抽 1,000 笔时保留欺诈拓扑结构(而非随机抽样破坏环),使小图仍含完整资金环——图数据抽样的正确姿势。
风控视角:图 EDA 不一定要图数据库:DuckDB(OLAP SQL)+ NetworkX + Gephi 的组合覆盖"特征统计 → 图构建 → 交互式可视化"全流程,适合案件级 ad-hoc 调查和原型验证;notebook 有 CI 验证(validate_notebook.py)是可复现性加分项。⚠️ 轻量 EDA,非生产管道。与 风控技术地图 的图算法关联。→ GitHub
7. FraudDetection (Engrziaullah) — GAN 数据增强 + RF 教学样本(20K 平衡合成数据 AUC 1.00,README 自我怀疑"值得以怀疑态度对待")【信号:★】
Engrziaullah/FraudDetection(0★, Jupyter, 3 commits 2025-04→08-17(昨日为 README 重写), 单 notebook FraudDetectionUSingGAN.ipynb + requirements + LICENSE)是 GAN 增强 + 调参 RandomForest 的教学级 notebook——数据为 20K 行平衡合成数据集(真实数据未随仓附带,Colab 路径)。
亮点是诚实:README 主动标记自己的 "AUC-ROC of 1.00 … worth treating with skepticism"——对完美指标自我怀疑,与 08-17 PayShield 的 model card 纠错、08-15 narendranathe 的自列缺陷同一文化谱系。
风控视角:"完美指标 = 红灯"的又一活教材:(1) AUC 1.00 出现在平衡合成数据上毫无意义——类不平衡才是欺诈场景的本质,GAN 增强前先问数据分布是否代表真实业务。(2) GAN 增强在欺诈检测中的适用边界(少数类合成样本会否引入分布偏移)值得作为模型验证 checklist 条目。⚠️ 教学级,无工程价值。与 风控模型 的评估关联。→ GitHub
技术趋势
- 恶意仓库进化为"伪造反病毒验证页 + 活载荷自动下载"(今日最重发现):tomkibjgray5429 的攻击链为三层分离——README 徽章 CTA(
[Download FinCrimeRadar Latest]×3 处)→ github.io 落地页index.html(base64+XOR 0xCF 混淆的document.write)伪造 AV 扫描页(假文件列表roblox_inject.dll/exploit_core.dll→ "No Threats Detected" → ✔ Virus Free 徽章)→setTimeout1.5s 自动下载密码保护Loader_v3.5.zip(Password: 2026防 AV 扫描),载荷托管于一次性 release-only 仓库(leon-gray9/kernel-space-i5wnqq,自述 "Official distribution channel",零代码零源文件)。与前 17 个已确认恶意仓库的区别:(1) 首次验证到活载荷(HTTP 302 → release CDN 仍在线);(2) 混淆落地页 + 自动下载取代"手动 extract"话术;(3) 载荷宿主与诱饵仓库分离,任一层单独看都更"合法";(4) 165 commits/2 周 bot farming +.github/update-logcron 痕迹(每 ~2h)维持仓库活跃假象。生成式账号家族第 3 例。静态解码(非执行)即可确认——验证手段需升级为"README CTA → 落地页 → 载荷仓库"全链检查。 - 防泄露纪律光谱推进到第 4 步:08-13 密封测试边界(HarshaSanka)→ 08-14 特征泄露 4.4× 量化(aghasalim)→ 08-17 PIT 正确性可运行测试(sentinel)→ 今日 PIT SQL 强制执行 + 特征契约审计(205/502 诚实申报)+ seed-noise bands(jjabuk)——防特征穿越从论述 → CI 门禁 → SQL 层强制 + 统计学验收(多种子方差带)。四步演进一个月内完成,已成开源社区工程共识。
- 规则引擎表达层多样化:08-09 fraud-engine "规则即 DB 行 + 解释执行" vs 今日 osprey "规则即 CEL 表达式 + typology 加权组合"——两条表达层路线并行成熟,共同点是非代码热更、可审计、可版本化;CEL 作为 CNCF 标准表达式语言进入风控规则选型视野。
- PaySim 固化为图欺诈方向的标准试验台:今日 7 条中 3 条用 PaySim(HariniReddy 时序 GNN、piyushlabde 可视化、victorhugo 图 EDA)——如同 IEEE-CIS 之于表格欺诈,图欺诈方向的社区基准正在 PaySim 上固化(合成但含真实资金转移拓扑)。
行业案例
- AML 交易监控开源化:osprey(CEL 规则 + FATF typology 组合评分 + 双模式 + open-core)
- MLOps 测量纪律:fraud-detection-mlops(seed-noise bands + 特征契约审计 + PIT SQL)
- 流式混合引擎:fraud-detection-engine(Kafka + PySpark + 规则 + IsolationForest)
- 欺诈环调查 UI:GraphNN-Fraud-Ring-Detection(instanced WebGL + 滚动叙事 + PyG 插槽)
- 图 EDA 工具链:paysim-fraud-network-analysis(DuckDB + NetworkX + Gephi + 结构化抽样)
- 威胁情报:tomkibjgray5429 恶意链(伪造 AV 页 + 自动下载 + 密码 zip + release 仓库托管)——反向案例
值得深入
- seed-noise bands 能否纳入我们的模型验收标准——jjabuk 用多种子方差带判定"提升是否超出噪声";多数离线实验 0.1% 级提升在种子噪声内。评估:在当前模型对比流程中加一档"多种子复跑"的成本与收益。
- 规则表达层选型:CEL vs SQL 行 vs JSON DSL——osprey(CEL + FATF typology 组合)与 08-09 fraud-engine(DB 行 + 解释执行)代表两条路线;自研规则引擎选型时应做可审计性/热更/性能三维对比。
- 恶意仓库全链验证与上报——今日首次确认活载荷(自动下载 + 密码 zip + release 仓库托管);采集脚本的 README CTA 检查应升级为"CTA → 落地页混淆检测 → 载荷仓库"链式规则;两个仓库(诱饵 + 载荷宿主)均应上报 GitHub abuse。