风控日报 — 2026-09-29

📊 筛选总结

  • 原料:48 条入文件 — GitHub 36 + 采集器 arXiv 12;HN / Trending 0 条通过过滤;HN Algolia 7 日 fraud 补查仍以政治类新闻与低信号条目为主(瑞典选举欺诈系列、假黑胶欺诈 4pt、Stripe Link 2pt),0 条入选
  • arXiv:采集器 12 条全部无关(新批次 2609.315xx-316xx,09-25 提交——API 缓存已破但仍 100% 噪声:MUD IoT 档案、coding-agent 文档基准、CLIP 后门防御、DP-PCA、逆向扩散、中子输运、量子存储等);词组直查 12 篇 — 10 篇已采 + 2609.30684 PixSim 即 09-25 已采论文(ID 去重漏、按名命中)+ 2609.09002 因子化执行(DB 系统论文,欺诈仅动机域)→ 直查连续第 3 期 0 新命中
  • 剔除 · 已覆盖/重复 17 条:SiteQ8/Asli[09-24 采]、malek-alhu/marketplace-phaas-tracker[08-15 采]、emailalias/disposable-email-detector[08-25 剔]、ipanalytics/IP-Knowledge-Layer[08-28 采]、FFraud-com 双库×2[07-14 采]、ldamasio/robson[09-28 采]、matrixarkai/TemporalStore[09-26 复核域外]、Shaky77/weiwen-law-dsh[09-26 采]、agparsa/trading-platform[09-26 采]、AayushH1510/portfolio-risk-engine[09-22 剔]、vridhib/obligation-net-optimizer[09-04 采]、nhoople/netrunner-engine[09-28 剔]、jugqdc-sudo/warden-desk[09-05 剔]、dovedownpat422/sanctioncheck[07-01 采]、Chrisolande/CounterFraud-GNN[09-28 采 今日复核结案]、mahima2604/autonomous-fraud-detection-engine[09-27 剔不定论]
  • 剔除 · 恶意残留 +0 新(累计维持 39):Amy7007/VPN-Detector[07-26 恶]、hgthangbq-lang/defi-risk-screening[07-26 恶]、yoelpa6680/upi-fraud-gnn[07-26 恶]、primatewakeisland574/payment-channel-guide[08-09 恶]、hypopigmentationnudemouse124/fraud-detection-analytics-case[09-20 恶]、sharonhopeless346/rwa-compliance-checklist[09-05 恶]、Cardinalfishepitaph683/credit-card-fraud-detection[07-09 恶 · 今日载荷复活:09-05 记录 zip 404 → 今日 200+584,990B,生命周期第 5 态,详见威胁情报专题]——7 个已判批次残留不重复验证
  • 剔除 · astroturf 0 新例(第 17 例后连续第 3 日零投放)
  • 剔除 · 域外/过薄 8 条:poorvik12/Cyber-Sentinal(网安运营域)、Stvrmay09/portfolio-fancial(投资域外)、Daniilwf/ivent + lcmaier/MTG-Ichor(游戏规则引擎×2)、malgrath/security-headers-api(HTTP 安全头非欺诈)、Ignite7871/Fraud-Detection-GNN(GCN 教程 notebook)、api-evangelist/incandor(第三方厂商档案 stub 系列第 3 例)、AppRangejn/audit-automation-case(召回/精确双 100% 指标不可信——"-case" 同名形态核查:无 zip 无下载 CTA,判教学仓非恶意)
  • 筛出:4 条 GitHub 工程 + 1 条跟踪复核结案 + 1 条威胁情报专题(6 条)
  • 主题一 · 流式无监督检测层回归"库级标准件":pysad(294★)16 种在线检测器+prequential 评估,当日还在修校准器方差 bug
  • 主题二 · 调查工作流仿真成新形态:fraud-watch 把"分析师永远看不到 ground truth"做成测试强制约束,与 PixSim[09-25] 构成仿真双极
  • 主题三 · AML 图检测的"查询即检测"路线:spanner-aml-graph 用 Spanner+ISO GQL 表达循环路由/分层检测(agent 构建工件链完整入仓)
  • 主题四 · 威胁情报:恶意仓生命周期第 5 态"复活"(Cardinalfishepitaph683 载荷 404→200)+A 对 2m41s 晨窗单刷+CounterFraud-GNN 排程 commit 结案

今日高信号

1. selimfirat/pysad — 流式异常检测的库级标准件:16 种在线检测器+校准+prequential 评估,294★ 六年老仓当日仍在修校准器方差 bug(Python(BSD-3-Clause,2020-06-05 建→09-28 密集推送,294★,889KB)——xStream、LODA、RS-Hash、Half-Space Trees、RRCF 等 16 种在线(流式)异常检测器+分数校准(GaussianTail 概率校准器族)+prequential evaluation(先预测后见标签的在线评估口径)+PyPI/readthedocs/Colab 全套发行;09-28 当日 6 commits:修 GaussianTailProbabilityCalibrator 在 running_statistics=False 时的方差 bug+修 Inqmad 无 JAX 时的导入降级+base 类补 type hints+mmh3/pandas 依赖升级)【信号:★★★】

selimfirat/pysad(294★, Python, BSD-3-Clause, 2020-06-05 建→09-28 23:31Z 推送, 889KB)README 8.2KB 工程级(PyPI/CI/docs 徽章);恶意 grep 零命中、Infrai×0。

风控视角:实时风控引擎的"无监督在线检测层"终于有了库级标准件——16 种流式检测器把 xStream/HST/RRCF/LODA 这些论文实现变成可 pip install 的组件,直接补位"无标签欺诈场景"(对照 Sim2200[09-27] 无监督补位、GTFD[09-24] 有监督保证的两端);prequential 评估是流式模型评估的正确口径(离线 AUC 在流式场景的陷阱:时间泄漏+分布漂移让历史指标失真);当日修的校准器方差 bug 是"校准器配置错误→分数系统性失真"的活教材——校准器假设(running_statistics 开关)与数据流不匹配时输出仍"看起来正常"。⚠️ 通用异常检测库(非欺诈专用)、各检测器效果强依赖数据集、294★ 主要来自 2020-2021 年积累。与 实时风控引擎 的无监督检测层、风控模型 在线评估章节直接相关。→ GitHub

2. Jeevan-0508/fraud-watch — 货运欺诈"调查工作流仿真":把"分析师永远看不到 ground truth"做成测试套件强制约束——行动有代价、2/3 异常有良性解释、输出按校准计分不打分(JavaScript(MIT,09-11 建→09-28 推送,1★,3.6MB,README 46.7KB)——确定性种子化的货运网络仿真(11 节点/11 边/4 路线/49 实体/9 生命周期阶段)+分析师调查工具链;核心设计承诺一句话:"把仿真里实际发生了什么、与分析师被允许观察到什么,分离开来"——且该分离是由 112 个外部测试套件强制检查的架构性质(55 个 JS 模块/20,600 行/无构建步骤/112 套件 0 失败);欺诈内容来自公共分类学(12 模式/87 指标/138 反制措施/31 误报);约 2/3 的异常带已文档化的良性成因;关联成案需要≥2 类不同信号+权重阈值(单一强信号刻意不够);7 种查证动作消耗模拟工时且可能"查无此记录";最终由人结案,判决按校准(calibration)计分、不打分****)【信号:★★★】

Jeevan-0508/fraud-watch(1★, JavaScript, MIT, 09-11 建→09-28 23:20Z 推送, 3654KB, README 46.7KB)层级管线(WORLD→ENTITIES→…→CONSEQUENCE 每层只消费上层记录);恶意 grep 零命中。

风控视角:第一个"调查工作流仿真"样本——欺诈演示的通病是 event→fraud 二元标签直接可见,本仓把证据面与真相面的信息不对称做成了被测试强制的一等架构性质:分析师拿到的是观测+噪声+误报+时序错位,必须自己决定。与 PixSim[09-25](银行侧拦截仿真:分析师容量+监管追回窗口)构成仿真双极——PixSim 仿机构决策容量约束,本仓仿案件证据经济学(查证花工时、可能空手而归、良性解释占多数)。"关联需≥2 类信号"是告警关联防误报的最小设计;"校准计分不打分"呼应"裁决留给人"的治理极性。对 风控归因 Agent 项目:调查 agent 的评估环境可直接按此设计——隐藏 ground truth+行动代价+校准计分,而不是 accuracy 打分。⚠️ 1★ 个人仓、物流域、自declared "not machine learning"(仿真非检测模型)。→ GitHub

3. mbonnardot/spanner-aml-graph — AML 知识图谱的"查询即检测":Spanner+ISO GQL 直接表达循环资金路由与分层,zero ETL——且是 coding agent 按 plan/spec 工件链构建的(Python(无 license,09-28 当日建仓,0★,34 文件)——Google Cloud Spanner 上的实时 AML 知识图谱:循环资金路由(circular fund routing)与分层(layering)用 ISO GQL 图查询+GraphRAG 表达,zero ETL lag;代码树完整:schema/aml_graph.sql+src/spanner_aml 七模块(cli/config/detector/loader/models/queries/schema_manager)+pyproject;seed 数据为 IBM HI-Small 交易集(AML 基准数据集);docs/superpowers/plans+specs 内嵌 09-28 设计文档——"superpowers" coding-agent 工作流的计划/规格工件与代码同仓**;注意仓内无 README)【信号:★★】

mbonnardot/spanner-aml-graph(0★, Python, 09-28 当日建→23:16Z 推送, 34 文件, 无 license, 无 README)API readme 端点 404(树内确认无 README 文件);恶意 grep 不适用(无 README);文件树核查无 zip、无可疑载荷。

风控视角:AML 图检测的"查询即检测"路线样本——检测逻辑=图查询(GQL 的 cycle/path 模式匹配)而非离线 GNN 批打分,对照 FoundAna(GNN 基础模型路线)与 spanner-aml(查询路线)构成 AML 图检测两极:查询路线的可解释性是天然的(SQL/GQL 语句即检测规则),代价是模式要人工枚举;分层检测(layering)的 GQL 表达正是 反洗钱-AML 图算法章节缺的工程参照。agent-built 角度:docs/superpowers 把计划→规格→代码的完整工件链留在一个仓里,是"用 coding agent 构建合规工具"的过程证据——对 风控归因 Agent 项目 的开发流程管理有直接参照。⚠️ 0★ 当日仓、无 README(部署/效果说明缺失)、GCP Spanner 深度绑定(成本与可移植性)、检测效果未验证。→ GitHub

4. Shubham-7781/FraudDetectionGNN — GraphSAGE 欺诈环检测微服务:每个标记带绑定洗钱拓扑的"人话"解释(ring/smurfing/aggregation)(Python(无 license,09-28 当日建仓 3 commits,0★,15 文件)——2 层 GraphSAGE(SAGEConv 4→16→1)节点分类+FastAPI 推理微服务与 Streamlit 仪表盘分离+NetworkX 交互图可视化;XAI:每个欺诈标记附 human-readable reason,词表绑定三类 canonical 洗钱拓扑(circular ring/smurfing fan-out/aggregation fan-in);合成数据引擎自供 4,415 笔交易×3 种欺诈拓扑(generate_dummy_data.py);Colab 训练 notebook)【信号:★(教学微缩)】

Shubham-7781/FraudDetectionGNN(0★, Python, 09-28 当日建→19:32Z 推送, 15 文件, README 13.6KB)代码树真实(gnn_model/train/api/dashboard .py+Colab notebook);恶意 grep 零命中。

风控视角:图检测的 XAI 输出绑定典型拓扑词表——每个标记解释为 ring/smurfing/aggregation 之一,解释词表即 AML 调查语义(对照 反洗钱-AML 的三类经典拓扑),比裸分数可行动;FastAPI/Streamlit 解耦是"模型服务化"的标准形状教学微缩(对照 ojuri[09-28] 的产品级同构)。⚠️ 全合成数据(自供)、0★、3 commits、README 营销化、无 license、解释是模板生成还是归因计算未披露。→ GitHub

5. 跟踪复核 — CounterFraud-GNN 未来日期 commit 结案:整段 commit 历史是预排程生成(13 天每天精确 11:00:00Z,含未来日期到 10-03)——非时钟错误,仓库降级为"叙事仓"(09-28 日报第 5 条的"待核"今日结案:commits API 全列 15 枚——09-21→10-03 共 13 天每天一枚 commit 全部精确打在 11:00:00Z(committer date==author date 完全一致),仅 09-27 两枚(21:24/22:23Z)为真实时间戳;含未来日期(09-29→10-03 已预写)→ 排程/预生成 commit 历史,非时钟错误)【信号:★★(尽调方法论)】

来源:Chrisolande/CounterFraud-GNN commits API(2026-09-29 核查,data/verify_risk_2026_09_29.py Part 3)。

风控视角:时间戳异常的两种形态必须区分——时钟错误(author≠committer、零散异常)vs 排程生成(整点 uniform stamping+跨天等间隔+未来日期);后者意味着"每日开发连续性"是人工制造的,repo 元数据整体不可作为尽调依据。09-28 条目"内容指标自洽"的判断修正为"叙事仓":0.709 AUPRC 等指标维持自报、checkpoint 仍公开(artifact 本身无异常),但开发时间线不可信。供应链尽调的一课:star、commit 活跃度、streak 都可以伪造,artifact(权重/基准脚本/测试)才是证据面——与 风控模型 的第三方评测要求互证。⚠️ 排程动机不明(叙事演示/刷活跃/其他),不据此否定内容本身。→ GitHub

6. 威胁情报专题 — 恶意仓生命周期第 5 态"复活"(Cardinalfishepitaph683 载荷 404→200+584,990B)+A 对 09-28 晨窗 2m41s 单刷+7 zip 字节零变化+argus 诱饵稳定第 4 期+astroturf/恶意双零(① A 对晨窗单刷:Zen7 09-28 07:09:22Z+TRDGNN 07:12:03Z(2m41s 窗,晨窗),B 对静默(末次 09-27 06:04Z)——09-27 同日双对(5s+3m00s)后回摆单对触碰,紧窗纪律保持(第 17/18 次观测全保持,观测下界 5s);② 家族 7 zip 全存活字节零变化:5 已知路径 HEAD 200 逐字节一致(deepguard 538,362B、trade-intel 531,063B、TRDGNN 三载荷 1,394,742B×2+587,686B),Zen7 双载荷树内尺寸核对一致(1,394,759B+584,580B)——静置态继续;③ 新生命周期态"复活":Cardinalfishepitaph683/credit-card-fraud-detection(07-09/07-13 两度剔除,09-05 记录"zip 已 404 但 README 下载徽章阵仗完整")——今日实测 src/fraud_credit_card_detection_3.5.zip HTTP 200 + 584,990B(585KB 家族带内)——"下架→复活"为继下架/轮换/静置/协调触碰后的第 5 观测态,404 不是弃号终点,已判 404 的恶意仓仍需低频复测;④ argus 诱饵稳定第 4 期:pushed_at 停 09-14,README 8,441B 与 09-26/27/28 三期一致(Lexi 计数 11→13 为本期大小写不敏感口径差异,字节不变=内容未变——字节是不变量,计数方法要固定);⑤ Infrai astroturf 0 新(第 17 例后连续第 3 日零投放);⑥ 恶意 0 新(累计维持 39):7 个已判批次残留不重复验证)【信号:★★★(威胁情报)】**

验证实录(主会话批量脚本 data/verify_risk_2026_09_29.py + r2/r3/r4):13 候选仓 API metadata+README 全文(api.github.com /readme raw 端点 12/13 成功,spanner-aml-graph 树内确认无 README)+恶意模式 grep+Infrai 计数;4 watch 仓 commits API(触碰窗口)+git trees recursive(zip 清单含 Zen7 双载荷尺寸核对);7 已知 zip raw HEAD 逐字节(7/7 200 一致,含 Cardinalfishepitaph683 复活载荷 584,990B);argus README 复测+pushed_at;CounterFraud-GNN commits API 全列(排程结案);AppRangejn "-case" 形态核查(无 zip 无 CTA+真实 py 树判教学仓);HN Algolia 7 日 fraud 补查(政治新闻为主,0 入选)。风控视角:监控语义两条沉淀:① 恶意仓生命周期模型补第 5 态"复活"——已知 404 载荷仍需低频复测,弃号判定从"路径 404"收紧为"路径 404 且 README CTA 消失且多期复测";② argus 观测的计数口径再次证明字节长度是唯一跨期不变量,词频计数必须固定大小写/分词口径才能跨期比较。已链接仓库名仅作威胁情报引用、永不作技术引用。→ deepguard(勿用)、Zen7(勿用)


技术趋势

  • 流式无监督检测层回归"库级标准件":pysad(294★,六年维护)把 xStream/HST/RRCF/LODA 在线检测器+校准+prequential 评估做成可 pip 组件——"无标签场景的无监督补位"从论文复现变成选型题;prequential(先预测后验证)是流式评估的正确的口径。
  • 调查工作流仿真成新形态:fraud-watch(证据面仿真:信息不对称+行动代价+校准计分)与 PixSim[09-25](机构容量仿真:分析师带宽+追回窗口)构成仿真双极——"调查/拦截决策"本身成为可仿真的研究对象。
  • AML 图检测两条路线同框:spanner-aml-graph 的"查询即检测"(GQL 模式匹配,可解释性天然)vs GNN 基础模型路线(FoundAna 等,泛化性优先)——工程取舍是可解释规则 vs 学习型表示。
  • repo 尽调红旗细化:排程 commit 历史:CounterFraud-GNN 结案——uniform 整点+跨天等间隔+未来日期=预生成时间线(叙事仓);时钟错误与排程生成要分开判,artifact 才是证据面。
  • 恶意仓生命周期补第 5 态"复活":Cardinalfishepitaph683 载荷 404 24 天后恢复在线(585KB 家族带内)——"下架/轮换/静置/协调触碰"之外新增"复活",404 弃号判定收紧为多条件多期确认。
  • arXiv 双通道:采集器新批次(2609.31xxx)API 缓存已破但仍 100% 噪声;直查连续第 3 期 0 新命中(批次由提交节奏决定)。

行业案例

  • 行为情报基础设施融资信号(Incandor,经 api-evangelist 第三方档案):YC S26 批次,定位"不依赖开户时身份验证的欺诈/滥用行为情报"——身份验证左移到持续行为信号的行业动向。
  • IBM HI-Small 基准集进入生产栈(spanner-aml-graph):学术 AML 基准数据作为 Spanner 图谱 seed,"基准数据→生产 schema"的复现路径。
  • 货运欺诈公共分类学(fraud-watch):12 模式/87 指标/138 反制措施/31 误报来自公开分类学——欺诈知识库的文档化形态参照。

值得深入

  • fraud-watch 的 112 个测试套件如何强制"信息分离":架构级测试的表达方式(哪一层不可见哪一层的字段)。
  • spanner-aml-graph 的 GQL 检测查询本体:cycle/layering 的 GQL 表达、Spanner 图能力边界、zero-ETL 的实现。
  • pysad 的校准器族:GaussianTail 等在欺诈分数校准的适用性与 running_statistics 开关的正确配置。
  • FraudDetectionGNN 的 XAI reason 生成机制:模板拼接还是归因计算。