风控日报 — 2026-09-12

📊 筛选总结

  • 原料:39 条入文件 — GitHub 仓库搜索 36 + arXiv 3;HN 21 条/Trending 20 条采集中 0 条通过相关性过滤
  • arXiv:3 条全部无关(新批次 2609.119xx,09-10 提交日期,非缓存:统一多模态模型 SenseNova-U1.5、分布漂移泛化理论 γ*-concept shifts、MoE 数据重复过拟合);全噪声连续 44 期(07-17→09-12),累计 882 条中 2 条相关,噪声率 99.8%,drop-all 默认维持
  • 剔除 · 已覆盖/重复 20 条:lucidfence[08-07]、FelipeGardenghiDev[09-10]、RazorPulse[09-05]、FFraud-com 邮箱+IP 库×2[07-14 已收录]、KILLADI-ui[09-10 已剔]、phaas-tracker[08-14 已入图]、OES[09-11 ★★]、TemporalStore[09-05 剔]、weiwen-law-dsh[08-27]、Vladimir-Ristic[09-10 剔]、obligation-net[07-01 剔]、portfolio-risk[投资域外]、warden-desk[09-05]、PolicyEngine 族[08-26 同域已剔]、mirabenchauhan 两仓[09-10 描述不符已剔]、Pranshu244[08-31 过薄已剔]、sushilpatil51p-ds[09-09 已剔]
  • 剔除 · 恶意残留 4 个(已确认不重复验证,累计维持 29 个):defi-risk-screening[07-26]、kamrujjamanzim/AI_Fraud_Detection[07-26]、Digressive-pulse731/fraud-detection-api[07-26]、yoelpa6680/upi-fraud-gnn[07-26];Infrai astroturf 第 7 例未现(采集流 0 指纹命中)
  • 剔除 · 域外/游戏 3 条 + 过薄新作 2 条:AI-landslide 山体滑坡、preferans/paradoxo 桌游规则引擎、Thanusiyaks Excel+PowerBI 千条 EDA、harshi1906 RF+Flask 教学作业
  • 筛出:7 条工程高信号 + 1 条威胁情报专题
  • 主题一 · 支付轨道知识工程化:FraudxAI 把 ISO 8583/AVS/RBI 规章编码成仿真基座,"ground truth 生成"正成为检测之前的基建层
  • 主题二 · 检测时刻后移:支付后价值流追踪(游戏内洗钱环)与历史泄漏数据洗钱取证,把风控视野从交易瞬间扩展到资金流全生命周期

今日高信号

1. Bhavyashah94/FraudxAI — 支付轨道校准的欺诈仿真+因果 XAI 基准:规章级 ground truth 生成器(仿真引擎按真实支付网络规章校准:ISO 8583 双消息生命周期(MTI 0100→0110 授权、0200→0210 清算,24-72h 结算延迟)+AFD 加油站 $175 预授权/餐饮小费容差/酒店押金窗口+STIP 代授权底线+AVS 街道/ZIP 矩阵裁决;印度轨道 RBI AFA/OTP 强制+NFC ₹5,000 免 PIN 上限+RuPay-UPI+CoFT 代币化;对抗欺诈 playbook 闭环——攻击者按银行响应码换策略(ISO 51 bisect 金额衰减、3DS Challenge 换收单网关、ISO 59 velocity backoff);四 feed 分区(auth_stream/gateway_telemetry/clearing_settlement/dispute_recovery,含 Visa 10.4/RBI 拒付理由码);ground-truth 特征归因向量+因果 XAI 基准;37/37 不变量验证+60 pytest+CI)【信号:★★★】

Bhavyashah94/FraudxAI(0★, Python, 09-10 新建→09-11 推送, 1MB, Apache-2.0, 17 commits)README 20KB 工程密度罕见:徽章阵仗(CI/pytest/invariants/ISO 8583|RBI AFA|Visa VCR 标准/Anti-Astronaut grounding)+AGENTS.md。验证确认 root 12 文件齐备(fraudx_synthesizer/spec/tests 分层+pyproject),无恶意模式。README 宣称与代码树一致性待深读(spec/ 目录未逐文件核对)。

风控视角:"合成数据的规章化"是新信号——此前的合成数据族(PaySim 教学用法、dbldatagen 交易模拟器)都停在统计分布层,FraudxAI 把支付轨道的协议规程与监管规章(预授权经济学的 MCC 级差异、AVS 裁决矩阵、RBI 客户责任分层)编码成生成约束+测试不变量,并让攻击者与银行引擎闭环博弈(按响应码自适应)——这与 09-09 AdaMule 的"训练侧对抗"谱系互补:AdaMule 约束扰动空间,FraudxAI 生成合规的对抗行为序列。四 feed 分区直指"真实数仓不是一张 flat 表"的评估常见病;dispute_recovery feed 把拒付/仲裁/责任分层纳入仿真,是本库首个把 chargeback 生命周期做进数据集的工作。仿真基座+因果 XAI 基准若可复现,将为"模型在分布偏移+对抗适应下的表现"提供可控试验床。⚠️ 单日新仓、合成数据天然带作者假设、XAI 基准指标 README 未展开(待验证)。与 风控模型 的对抗评估和 反欺诈体系 的数据基建相关。→ GitHub

2. xsolla-baku-gametech-hackathon/team-UNECom — 游戏内价值洗钱追踪:支付后 taint 传播+Louvain 洗钱环发现(Fraud Tracker: stolen-card 资金买入游戏币/道具/Key 后并不停留——通过交易/赠送/市场出售/Key 转移在账户间漂洗直到可变现;输入事件日志(trade/gift/marketplace/key redeem/purchase)构建有向价值流图,账户按 taint(被标记资金触达比例)+velocity(新户高频)+出/入度不平衡(经典 mule→hub 形态)三信号评分;Louvain 社区发现整环而非单账户;Claude 只为每个标记环写人类可读的案件叙述——证据+置信度、永不出自动裁决,人工分析师终审;力导向图 live 台+敏感度滑杆;render.yaml 部署+live demo)【信号:★★】

xsolla-baku-gametech-hackathon/team-UNECom(3★, TypeScript, 09-10 新建→09-11 推送, 862KB, 无 license, 164 commits)Xsolla Baku GameTech Hackathon 2026 参赛作:api/engine/web/data-generator/docs 五模块分层+render.yaml+live dashboard(fraudtracker.bratiks.com)。164 commits 的 hackathon 冲刺密度罕见(平均每天 80+)。验证无恶意模式,root 结构真实。

风控视角:两个补位。场景补位——支付后资金流纵深:本库此前 12+ GNN 样本全部在"支付时刻"截断,team-UNECom 指出盗卡资金的真实生命周期在支付之后(游戏经济是洗钱价值转移的高速通道,对照国内"游戏币商"跑分场景);数据方法论补位——taint 传播(污染资金比例沿交易边扩散)是比特币混币分析的经典技术,移植到游戏经济事件日志是干净的跨域迁移。治理线上,"Claude 写 case 叙述+人工终审"是"LLM 永不决策"治理线(feelc[09-10] 创作域退出、app-fraud-interdiction[09-10] 拦截域文案化)在调查域的第三个同构落点:LLM 的产物=可审计叙述,裁量权留在人。⚠️ hackathon 属性、无 license、Louvain 无离线评测基准、164 commits 是否持续维护待观察。与 反欺诈体系 的资金链调查和 风控归因 Agent 项目 的"证据+置信度"模式直接相关。→ GitHub

3. DerwenAI/azeri_laverie — Azerbaijani Laundromat 泄漏银行数据的图取证:真实洗钱网络的公开教学样本(基于 OCCRP 泄漏的 Azerbaijani Laundromat 银行记录(2.5 万笔、多国壳公司分层转账洗白政治资金的历史大案):三件套——ABSTRACT.md(案例与数据来源导论)、TRADECRAFT.md(洗钱手法详解+行业专家分析摘录)、occrp.ipynb(对泄漏银行记录做 forensic auditing:图算法+网络分析识别犯罪 tradecraft);数据含免责声明(含合法交易,出现名字≠不当行为);Poetry 管理的 Jupyter 工程)【信号:★★】

DerwenAI/azeri_laverie(0★, Jupyter, 09-03 建→09-11 推送, 1.4MB, MIT, 22 commits)Derwen AI(KDDS 作者 Paco Nathan 的咨询公司)出品:notebook 478KB 实算、TRADECRAFT.md 17KB 手法知识库、ABSTRACT.md 20KB 案例导论,poetry.lock+pyproject 工程完整。验证无恶意模式,root 11 文件齐备。

风控视角:AML 教育缺位的"真实数据"补位——本库 AML 样本的图算法多跑在 IBM HI-Medium 合成数据或 Elliptic 上,azeri_laverie 提供了历史真实洗钱网络(shell 公司多层过账的手工层叠结构)的公开可复现取证分析:图结构长什么样、资金如何在层间稀释、专家如何解读——TRADECRAFT.md 的手法分类(层叠/过账/空壳嵌套)可直接对照国内 AML typology 库(银反可疑交易模型手册的"分散转入集中转出"等)做映射练习。MIT+真实数据+专家叙事的组合在 AML 教学资料里稀缺。⚠️ 数据集为 OCCRP 泄露材料的再分发(法律边界以原发布为准)、notebook 分析深度未逐 cell 审。与 反欺诈体系 的 AML 章节相关。→ GitHub

4. Mohamed-ahmed-shokry/Credit-Card-Fraud-Detection — 三年老仓的正规化样本:泄漏安全+未触碰测试集+版本化 API("可复现、泄漏安全"的信用卡欺诈检测系统:分层/时序 train-val-test 三分且 test 全程未触碰、类权重+阈值调优的失衡感知决策、批处理 CLI+versioned HTTP API+模型 metadata、硬化容器部署;适配 Time/V1-V28/Amount/Class 匿名数据集 schema 及任意全数值二分类特征集;CI+Release 徽章+CHANGELOG 13KB+ROADMAP+SECURITY.md)【信号:★★】

Mohamed-ahmed-shokry/Credit-Card-Fraud-Detection(0★, Python, 2023-08 建→09-11 推送, 385KB, MIT, 200 commits)不是新仓——三年历史的持续正规化:README 27KB"为什么这个项目不同"开篇即诚实评估(分层/时序分割+未触碰测试集)+决策阈值显式调优。验证确认 root 18 文件(src/tests/Dockerfile/compose/CHANGELOG/ROADMAP/SECURITY 全件套),无恶意模式。

风控视角:"评估即证据链"谱系的工程完整性锚点——此前的谱系记录过 cher-ry(PR-AUC=1.0 当 bug 报告)、Vignesh(泄漏三分类)、jeganathan(PaySim 完美指标反面教材),Mohamed 这份补上"一个普通的 ULB 数据集项目应该长成什么样":不吹指标绝对值,把纪律(未触碰测试集/阈值校准/版本化 API/安全加固容器)做成默认。对教学族的启示是老仓可信性可以正向演化(对照 09-09 sentinel-upi README 追平代码、与 TRDGNN 变脸相反的第三例正向案例)——收录时的 README 快照基线既能抓恶化也能记改善。200 commits/3 年的维护韧性在教学族中罕见。⚠️ 数据集仍为 ULB 匿名特征(PCA 后无业务语义)、模型层无新方法论。与 风控模型 的评估纪律相关。→ GitHub

5. emedinac/data-product-for-credit-and-fraud-analytics — Customer 360 数据产品实验:数据契约+SLO+血缘的需求规格蓝本(面向支付/欺诈/组合分析三消费者的 Customer Data Product:PROBLEM.md(20KB)以"PayFlow Financial Services"虚构场景完整陈述痛点——各团队口径不一/欺诈模型用不同版本行为指标/血缘不可追溯/ML 无法复现训练数据——并开出数据产品的完整需求清单(契约/schema/语义定义/所有权/质量期望/SLA/访问策略/血缘/版本化/监控);airflow 编排+75KB 合成数据生成器+Streamlit 台+src 分层)【信号:★★】

emedinac/data-product-for-credit-and-fraud-analytics(0★, Python, 09-11 当日新建, 178KB, 无 license, 20 commits)。README 仅 118 字节(营销面残缺),但 PROBLEM.md 是全仓的真正规格书。验证确认 root 15 文件:airflow/docker-compose/streamlit_app/fake_data_generation.py(75KB)/docs/.agents 全在,无恶意模式。

风控视角:特征平台/数据契约纪律的实验样本——风控团队的经典痛点是"欺诈模型的特征口径与业务报表对不上",PROBLEM.md 把这个痛点按 Data Mesh 话语完整规格化(数据契约/SLA/所有权/血缘/版本化),并让欺诈检测/ML 作为一等消费者。与 09-11 CASHNET 的"数据血统工件化"同线,但视角从调查端转到平台端。仓库当前更像"需求规格+脚手架"而非成品(AGENTS.md 显示为 AI agent 驱动开发的实验仓),概念价值>当前实现。⚠️ 单日新仓、README 残缺、无 license、实现完成度低。与 实时风控引擎 的特征平台章节相关。→ GitHub

6. sechan9999/ClaimsAI — 理赔分析 GenAI 原型:语义层替代 text-to-SQL 的可审计路径(患者理赔分析原型:自然语言提问经语义模型(tables/measures/dimensions 透明视图)而非自由 text-to-SQL 生成答案——结果可审计且一致;欺诈检测每张理赔打分(IsolationForest 同行组金额偏离+同日重复计费+超频就诊+提交滞后离群四信号)且每个标记附平语解释;Cortex Analyst/Complete 的 Streamlit-in-Snowflake 部署路径+执行摘要报告+live demo)【信号:★】

sechan9999/ClaimsAI(0★, Python, 09-11 当日新建, 850KB, 无 license, 1 commit)app/fraud/llm/nlq/reporting/semantic/sql/warehouse 八模块分层。验证无恶意模式;live 主页在 repo metadata(本session未复测连通性)。

风控视角:保险理赔垂直+语义层治理的结合点——"NL 查询走语义层而不是自由 text-to-SQL"与 09-11 sentinelpay- 的 versioned policy 同一治理直觉:让 LLM 在受约束的解释层工作,事实由确定性层产生。四信号理赔欺诈族(同行组偏离/重复计费/就诊频率/提交滞后)是美国医保欺诈的典型规则集,与 09-08 cher-ry 真实理赔数据样本互补为"规则+无监督"组合。⚠️ 1 commit 单日仓、合成数据、无 license、语义层实现深度未核。与 风控策略 的保险风控场景相关。→ GitHub

7. Muthu-Harish-G/Megathon-2026 — 电商退货欺诈的逆向物流风险引擎:文档取证+动态摩擦(exposure 定价的退货欺诈引擎:对退货申请做单据(receipt PDF)元数据取证(7a 生成/7b 校验/7c 集成三脚本+评分 manifest),按暴露度动态调整摩擦强度而非一刀切;评测摘要直报:13 个账户在重复欺诈累积前被前置标记(61.5% 后获证实)、任意摩擦召回 97.2%、精确 90.3%、合法客户受扰率 2.0%、硬拒绝精确 100%;单页 HTML dashboard+样本单据 zip)【信号:★】

Muthu-Harish-G/Megathon-2026-track-…-Real-Time-Fraud-Detection-for-Online-Retail(0★, HTML, 09-11 当日新建, 96KB, 无 license, 1 commit)Megathon 2026 hackathon 参赛作:无 README,但 evaluation_summary-3.txt 的指标口径完整(区分任意摩擦与硬拒绝两档的精确/召回/FPR)。验证无恶意模式;384KB 单页 HTML 为打包 dashboard。

风控视角:退货欺诈+摩擦经济学的小众补位——"按暴露度定价摩擦"(高价值申请强校验、低风险放行以免误伤诚实客户)是 09-09 txnzeel 成本阈值决策的退货域镜像;receipt PDF 元数据取证与 09-11 OES 的 receipt 图像审计同构(费控/退货两场景共享"单据验真"原语)。评测摘要的"前置标记 61.5% 后获证实"口径罕见地报告了标记的预测有效性而非仅分类指标。⚠️ 1 commit 无 README(工程不可评估)、hackathon 属性、单据取证逻辑仅 3 个小脚本。与 支付风控 的摩擦设计相关。→ GitHub

8. 威胁情报专题 — zip 家族第 4 日全存活:逐字节同尺寸复现;Infrai astroturf 第 7 例未现(① 昨日 3 个恶意仓 zip 复测:TRDGNN Software-v1.4.zip 200/587,686B、sulemanyou card-detection-fraud-credit-v3.1.zip 200/587,686B(与前两者逐字节同尺寸——同构建管线指纹第 3 日复现)、Zen7 Zen_Payment_Agent_v1.7.zip 200/584,580B——无一 404,威胁窗口连续 4 日未关;② Infrai 战役:今日采集流 0 指纹命中(INFRAI_API_KEY/llms.txt/响应封套三件套 grep 无新增),第 6 例(CianWinslow370[09-11])后复制暂歇;③ 恶意仓库累计维持 29 个(今日 0 新增,4 个已知残留出现在采集流不重复验证))【信号:★★★(威胁情报)】

验证实录(主会话 Python urllib HEAD 探活):三 zip 全部 HTTP 200 且 content-length 与 09-10/09-11 记录逐字节一致(587,686×2+584,580)。风控视角:zip 家族存活周期数据点 +1(4 日),"复查是否 404"的弃号监测继续;Infrai 战役的复制节奏(09-08 两例→09-11 一例→今日 0)提示观察窗口从"每日计数"转为"节奏突变告警"。已链接仓库名仅作威胁情报引用、永不作技术引用。→ TRDGNN


技术趋势

  • 支付轨道知识工程化:FraudxAI 把 ISO 8583/AVS/STIP/RBI AFA+CoFT 等规章规程编码成生成约束+测试不变量,并让攻击者按银行响应码闭环自适应——合成数据正从"统计分布"走向"规章级 ground truth","检测之前的仿真基座"成为新的基建层(与 AdaMule 训练侧对抗互补)。
  • 检测时刻后移:team-UNECom(支付后游戏内价值漂洗追踪)与 azeri_laverie(历史泄漏数据洗钱图取证)从两个方向把风控视野扩展到资金流全生命周期——交易瞬间之后还有 laundering,交易发生之前还有历史案件取证。
  • "LLM 永不决策"治理线延伸到调查域:team-UNECom 让 Claude 只写案件叙述(证据+置信度),ClaimsAI 让 NL 查询走语义层而非自由 text-to-SQL——治理线(feelc 创作域退出→app-fraud-interdiction 拦截域文案化→今日调查域叙述化+查询域语义化)在风控全工作流的每个环节落位。
  • 评估诚实度持续:Mohamed 老仓的"未触碰测试集+阈值显式调优"、Megathon 的"标记预测有效性 61.5%+FPR 2.0%"直报——"主动披露边界"(09-11 CASHNET/sentinelpay- 兴起的三色标注)继续成为新仓差异化信号。
  • 威胁情报双线:zip 家族 4 日存活+逐字节同尺寸复现(同构建管线);Infrai astroturf 复制暂歇(节奏观察替代每日计数)。

行业案例

  • 游戏内经济洗钱(Xsolla Baku hackathon):盗卡资金→游戏币/道具/Key→交易漂洗→变现——支付后价值流的完整威胁模型(team-UNECom)。
  • Azerbaijani Laundromat(OCCRP 历史大案):2.5 万笔泄漏银行记录+壳公司多层过账的图取证样本+手法知识库(DerwenAI)。
  • 印度电商退货欺诈(Megathon):单据元数据取证+按暴露度动态摩擦,两档处置(摩擦/硬拒绝)分列指标。
  • 印度支付轨道合规(FraudxAI):RBI AFA/OTP、NFC 上限、CoFT 代币化等监管规则的工程化还原。

值得深入

  • FraudxAI 的因果 XAI 基准:spec/ 目录的基准指标定义(反事实保真?ATE 误差?)与四 feed 的数据量级——README 未展开,决定其"基准"成色。
  • team-UNECom 的 taint 评分离线评测:敏感度滑杆无基准支撑,taint 阈值-洗钱环检出率的 ROC 需要标注数据(hackathon 未给)。
  • azeri_laverie 的 notebook 分析深度:图算法具体用了哪些(连通分量/社区发现/中心性)?能否复用到国内洗钱案例数据?
  • zip 家族溯源:4 日逐字节稳定说明静态构建物未重建——解包对比元数据(时间戳/注释字段)的溯源价值在下降,README 模板聚类仍是主指纹。