风控日报 — 2026-09-08

📊 原料:53 条入文件(GitHub 仓库搜索 42 条 + arXiv 11 条全部无关——新批次 2609.053xx/2609.054xx(09-04 提交日期,非缓存):TOI-426/1839 亚海王星、3I/ATLAS 彗星离子、SSC SBOM 传播模型(软件供应链安全域,非欺诈)、UniMate 骨骼动画、宇宙原初密度场重建、DESI DR2 暗能量、AdS₅×S⁵ 关联函数、量子微调时间序列、ROBORMBench 机器人奖励模型、LLM 解释必要性/充分性行为评估(最接近风控的一条,纯方法论无应用)、无线信号生成模型。arXiv 全噪声小计:连续 41 期(07-17→09-08)全噪声,累计 844 条中 1 条相关,噪声率 99.9%。剔除构成:12 条已覆盖/重复(marketplace-phaas-tracker[08-14 已入图]、disposable-email-detector[08-25 已剔]、FFraud-com 邮箱+IP 库[07-14 ★已收录]、lucidfence[08-07]、ameva-sentinel[09-02]、TemporalStore[09-05]、obligation-net-optimizer[09-04]、finpulse[09-02]、warden-desk[09-05]、sanctioncheck[07-01 ★★]、fintech-document-risk-service[09-03 已剔]、perishable[07-01 已剔])+ 10 个已确认恶意仓库残留不重复验证(sentinel-detection-engine[07-27]、fraud-detection-analytics-case[09-02]、defi-risk-screening[07-26]、credit-card-fraud-detection[07-26]、SnifTern.ai[07-26]、payment-channel-guide[08-09]、rwa-compliance-checklist[09-05]、LLMInjector[09-05]、upi-fraud-gnn[07-26]、Para99999/payment-fraud-detector[07-26])——今日 0 新确认恶意仓库(09-05 后重新起算 1 日),恶意仓库累计维持 26 个+ 9 条域外/过薄(awesome-scam-protection-vn 资源列表、AIFA-Webmaster/aifa-agentic-commerce 空壳 stub:1KB 仓库仅 README+1 commit,营销词 "Agent Passport™" 指向 aifuture.asia、Irish 租控规则引擎、Magic 卡牌规则引擎、plutus-hr 尼日利亚 HR payroll、FinGuard-GNN 单句泛描述、saba-data/RealTime-FraudGNN-Engine 模板 README 残留 your-username 克隆占位符+2 commits+预置 .pth、land-management 洪都拉斯地产)+ 2 个新确认 astroturf(见威胁情报专题:Infrai 战役第 4/5 例,Go 单二进制支付风控新变体)。今日筛出 9 条工程高信号 + 1 条 astroturf 威胁情报专题。今日主题一是"LLM 永不决策"治理线第 6 跃迁:验证外移——aegis 把"人类已批准"从 agent 的自述变成 MCP elicitation 协议事实+运营商 CAMARA SIM-swap 预检,kyc-aml 把策略检查钉在工具调用边界(PEP),同日出现"协议级/网络级/工具级"三种验证外移机制;主题二是评估即证据链第 7 站:泄漏即 bug 报告——cher-ry 把 PR-AUC=1.00 的数据泄漏调查写成 README 核心章节。


今日高信号

Xaena53/aegis(0★, TypeScript, 08-11 建→09-07 推送, 2.3MB, AGPL-3.0)的问题框架:把 LLM 接到广告账户上花钱,多数集成靠"让 agent 确认"——这意味着 agent 自己决定人类是否被咨询过。aegis 把这个决定从 agent 手里拿走:elicitation 让人类确认成为协议层事实,CAMARA 让"账号是否被接管"成为网络层事实验证。土耳其作者(README.tr.md 双语)。

风控视角:"LLM 决策边界"谱系(08-27 governor 架构隔离→09-02 证据 schema→09-03 代数钳位→09-04 跨域治理核→09-05 默认化→今日验证外移)的第 6 跃迁——治理机制第一次同时落到两个新层面:协议级(MCP elicitation 使"人类在环"可验证)与网络级(运营商 SIM-swap 状态作为支付前信任信号,GSMA Open Gateway 商用化的一次真实工程落地)。SIM-swap 预检与国内运营商联名反诈的"人号一致性"校验同构。⚠️ 测试/覆盖率数字为 README 徽章自报(待验证)。与 风控归因 Agent 项目 的证据约束和 支付风控 的交易前校验直接同构。→ GitHub

2. cher-ry2003/insurance-fraud-risk-scoring — 把 PR-AUC=1.00 当 bug 报告:保险理赔反欺诈的"泄漏调查"叙事(车险/健康险理赔欺诈评分全栈:dbt 特征层+44 个数据质量测试(其中一个真抓到源数据异常);开发期测试集 PR-AUC 冲到 1.00——作者定位为"不是值得骄傲的结果,是 bug 报告",完整记录泄漏调查与修复(README 核心章节 "A leakage investigation, not a leaderboard score");类不平衡处理有据对照(class weighting vs SMOTE);XGBoost+SHAP 平语化解释("为什么被标记"面向非技术审查员);DuckDB 本地/Snowflake 生产同一 dbt 项目;FastAPI 评分+Streamlit 审查台;CI 门禁)【信号:★★★】

cher-ry2003/insurance-fraud-risk-scoring(0★, Python, 09-07 单日新建, MIT, 4 commits)自我定位是作品集项目,但工程判断是主菜:泄漏识别→调查→修复→把过程写成一等叙事,明确说"重点在模型周围的工程与判断(数据质量/泄漏/不平衡/可解释性/诚实局限),不在榜单指标的最后 0.1 个点"。

风控视角:"评估即证据链"谱系(预注册→conformal→对抗逃逸→监控自审计→自评 MIXED[09-04]→命名失败模式[09-05]→今日泄漏即 bug 报告)的第 7 站——与 Card-Testing-Sentinel 的"自评不合格"同属诚实申报,但更进一层:完美指标本身就是数据流程故障的告警器,这是国内风控建模最该抄的纪律(离线 AUC 高得离谱≈特征穿越)。保险理赔是本库追踪首次入场的新垂直(此前信贷/支付/电商/AML),44 个 dbt 测试的理赔特征层可直接对照 风控模型 的特征治理。⚠️ 单日新仓、4 commits、0★。→ GitHub

3. RaviTejaMandapati89/kyc-aml-multiagent — 工具调用边界的策略执行点:MCP 授权检查模板(四阶段合规管道:Gemini 工具循环跑 KYC 筛查(MCP server 挂 7 个合规工具:客户摄入/文件核验/PEP+制裁筛查/风险评分/升级/审计日志/视觉文档分析),每次工具调用先过 policy.evaluate 再执行(mcp_server.py 即策略执行点 PEP);Bedrock Claude 做 AML 深度推理,引用英国法条(POCA 2002/MLR 2017/FCA SYSC),经 A2A 从 Vertex AI 交接;LangGraph 路由后决策工作流(Standard Onboarding/EDD/Financial Crime Investigation+SAR 考量+材料清单);Gemini Vision 文档核验带 PII 护栏(拒收疑似真实个人证件图);自评诚实:"Not production software, a working prototype using synthetic data only")【信号:★★】

RaviTejaMandapati89/kyc-aml-multiagent(0★, Python, 02-22 建→09-07 推送, 44MB, 28 commits, 无 license)的工程骨架清晰:google_agent.py(MCP client)→ mcp_server.py(PEP,7 工具单一 dispatch)→ policy.py(授权评估)→ a2a_server.py(跨云交接)→ review_graph.py(LangGraph 路由)。tests/ 目录与 observability.py 齐备。

风控视角:"LLM 决策边界"的工具级实现样本——与 09-04 virtualryder 的 Cedar no_self_* 工具拒绝同谱系,但给出了更轻的自建模板:策略检查内嵌在 MCP dispatch 里,LLM 选择"调用什么、什么顺序",能否调用由策略层裁定;KYC→AML→SAR 路由与国内"开户筛查→可疑行为识别→可疑活动上报"流程同构;跨云 A2A(Vertex AI↔Bedrock)是 agent 互操作的真实工程样本。与 反洗钱-AML 的筛查工作流和 风控归因 Agent 项目 的工具约束相关。→ GitHub

4. Imperator8000/real-time-fraud-detection — PySpark 有状态流特征教学样本:watermark+滑动窗口+applyInPandasWithState(Kafka→PySpark Structured Streaming→Delta Lake Medallion(Bronze/Silver/Gold+隔离区 quarantine)→随机森林分布式推理→Streamlit 监控台;事件时间处理+watermark+10m 滑动窗口/2m 步长;applyInPandasWithState 维护 per-user 任意状态历史(有状态行为特征);混合特征装配(窗口特征+状态特征)→不可变 Gold 特征事件;幂等写入+checkpoint 恢复+性能基准;docker compose 一键 demo;MIT)【信号:★★】

Imperator8000/real-time-fraud-detection(0★, Python, 09-05 建→09-07 推送, 1.2MB, MIT, 7 commits)定位"portfolio-grade 分布式流工程,不是静态 ML notebook":数据质量+去重+隔离区分层、窗口与状态两类特征的装配边界清晰、文档含架构 mermaid 图与 demo 截图画廊。

风控视角:实时计算栈(Flink/Kafka/CEP)教学族的 PySpark 版完整样本——此前 sentinel-rto[09-05] 是 Flink 版,本仓补上 Spark Structured Streaming 版:applyInPandasWithState 是 transformWithState 之外的 per-user 状态管理实战代码,事件时间+watermark+滑动窗口的特征工程骨架可整体平移到国内实时特征平台设计;"窗口特征+状态特征"二分法是实时特征分层的清晰表述。⚠️ 作品集项目、Random Forest 选型保守、单机 docker demo 非生产拓扑。与 实时风控引擎 的流式特征栈直接相关。→ GitHub

5. abdullahabduljabbarab/risk-engine — 决策先于资金移动:确定性规则引擎的"可回放"主张(三值决策 ALLOW/REVIEW/BLOCK+分数+可解释原因,支付编排器在预留任何资金之前等待该决策——风险支付在钱动之前被拦住;明确"评分是确定性加权规则引擎,不是模型",每一笔决策可解释可回放;行为状态异步从事件构建,决策路径独立于它但"永不对其新鲜度失明"(freshness 门);ABS Financial Systems 三服务之一(ledger 管钱/orchestrator 管生命周期/risk 管决策+行为证据),Pub/Sub 传递事实;Cloud Run 部署+Terraform IaC+Workload Identity Federation 无密钥 CI;live Swagger UI 在线)【信号:★★】

abdullahabduljabbarab/risk-engine(0★, Python, 09-05 建→09-06 推送, 2.5MB, MIT, 14 commits)的差异化主张是决策点位与决策方式的组合:点位上"先于资金预留"(pre-authorization,与 09-04 Card-Testing-Sentinel 同点位);方式上反潮流选确定性规则而非 ML——理由是可解释+可回放(replay),并把"行为状态新鲜度"显式建模为决策输入的一部分。terraform/ 目录+CI 徽章+live docs 显示工程完成度高于典型单日仓。

风控视角:"规则还是模型"论述的新对照锚点——在 GNN/XGBoost 泛滥的追踪流里,一个明确为"可回放性"放弃模型的样本给面试论述提供了双面论据:规则=可回放+可解释+零训练漂移,代价是策略覆盖上限;"决策独立于异步状态但受其新鲜度门控"是实时决策与离线特征边界的一句标准表述。三服务拆分(账本/编排/风控)是国内支付系统风控嵌入位置的一手参照。与 实时风控引擎 的决策点位和 风控策略 的规则治理相关。→ GitHub · Live Swagger

6. Liiiyonx/vericall — AI 拟声电话诈骗拦截三通道:声学伪造检测+家庭声纹白名单+LLM 话术风险(AASIST 声学伪造检测(dev EER 0.745%)+家庭声纹+LLM 话术风险三通道融合决策;repo 内含 evaluation/ 目录、configs、training_dashboard.html、training_ep30.log(30 epoch 训练日志在库)、tests/、docs/;中文项目,独立开发;license NOASSERTION(自定义))【信号:★★】

Liiiyonx/vericall(0★, Python, 09-06 建→09-07 推送, 7.8MB, 100+ commits 单日批量推送)打的是AI 拟声(voice-clone)电话诈骗:来电声音先过 AASIST 深度伪造声学检测,再对照家庭声纹白名单(陌生"亲人声音"直接可疑),LLM 并行分析通话话术的风险模式,三通道融合出拦截决策。

风控视角:国内反诈最热的 AI 拟声诈骗("AI 换脸拟声"骗局)的开源工程对照——三通道设计对应三类独立证据:声学层(合成痕迹)、身份层(声纹比对)、语义层(话术模式),与 反欺诈体系 的多信号融合同构;"家庭声纹白名单"是个体化基线的语音版(白名单外人声即信号);AASIST 是声学伪造检测的标准基线模型,EER 口径为 dev 集自报(待验证)。⚠️ 单日批量推送、自定义 license、无第三方评测。→ GitHub

7. si126048/Enterprise-Public-Opinion-Risk-Control-System — 舆情风控全栈:7 因子信度模型+LLM 自动审核(FastAPI+SQLite+DashScope(阿里云 text-embedding-v3 1024d+qwen-plus)+ChromaDB;7 平台爬虫(微博/小红书/知乎/B站/TapTap/小黑盒/米游社);8 大风控主题+32 语义锚点;向量相似度主题路由(known/uncertain/unknown 三级)+HDBSCAN 未知主题发现;7 因子信度评分(粉丝量/活跃度/互动真实性/内容一致性/信度强度/平台可信度/领域权重);AI 审核代理自动批准/合并/忽略候选主题+4 提供商交叉验证;JWT+14 路由模块+40+ 端点+docker)【信号:★】

si126048/Enterprise-Public-Opinion-Risk-Control-System(1★, Python, 09-07 单日新建, 405KB, 27 commits, 无 license)以米哈游/游戏行业为示例,完整跑通"采集→语义路由→主题发现→信度评估→AI 审核"的舆情风控管道。

风控视角:两点值得取用:其一,7 因子信度模型里的"互动真实性"因子本质是水军/刷量检测( engagement authenticity),与营销反作弊同源;其二,AI 审核代理的"自动批准/合并"与金融侧"LLM 永不决策"形成反向对照——内容风控里 LLM 已经在自主做低风险决策(主题合并),说明"永不决策"纪律的适用边界是资金与处罚动作,不是信息操作;向量路由三级分类+HDBSCAN 兜底未知主题是"已知规则+未知发现"的通用风控架构。⚠️ 域外(舆情≠金融风控)、单日新仓、无 license。与 风控策略 的内容风控边界相关。→ GitHub

8. Muskan3767/Phishing-Detection-using-Advanced-Graph-Learning-Techinque — motif 采样抓以太坊钓鱼账户:8 步 notebook 流水线(以太坊交易网络钓鱼账户检测:motif-based sampling(s-METS motif 计算+语义采样)捕捉可疑模式+交易特征(金额/频率/时间)注入节点特征;8 个 Step notebook 从数据清洗→节点标签生成→建图→特征工程→传统 ML 基线→GNN 模型(Lite_gtsf 与 paper_gtsf 双版本)→带数据集 CSV(labeled_accounts/motif_profiles/node_features))【信号:★】

Muskan3767/Phishing-Detection-using-Advanced-Graph-Learning-Techinque(0★, Jupyter, 04-10 建→09-07 推送, 7.2MB, 1 commit, 无 README 无 license)的信号在方法名:motif-based 采样是图欺诈检测里"子结构模式"路线(对比 GraphSAGE 的邻域聚合路线),notebook 顺序完整可复现。

风控视角:图欺诈检测的采样策略对照样本——motif(三角形/星形/环)是团伙资金链的拓扑指纹,与 Elliptic/HI-Medium 上邻域聚合 GNN 的正负结果对照(09-03 AML-Graph +8pp / Elliptic 负结果)构成第三条技术路线;传统 ML 基线先行(Step5)再上 GNN 的实验纪律值得表扬。⚠️ 无 README(方法全在 notebook 内)、无 license、1 commit。与 反欺诈体系 的图算法和 反洗钱-AML 的链上分析相关。→ GitHub

9. waittim/graph-fraud-detection — 55★ DGL 图欺诈教学基准仍在维护(IEEE-CIS 数据集上的 GNN 欺诈检测 Colab 教学(DGL+PyTorch backend):10_data_loader/20_modeling/30_visual 三本 notebook+train.py+gnn/ 模块;2021 年建仓、55★、09-06 仍有推送(维护中)、MIT)【信号:★】

waittim/graph-fraud-detection(55★, Jupyter, 2021-04 建→2026-09-06 推送, 64MB, MIT)是中文社区流传最广的图欺诈检测教学仓之一,Colab 三连(数据加载→建模→可视化)降低复现门槛。

风控视角:GNN 入门教学基准的"活旧仓"——与今日 Muskan 的 motif 路线、saba-data 的 PyG 路线(已剔)构成 DGL/PyG/手写 motif 三种生态对照;对面试场景,它是"图欺诈检测怎么入门/怎么讲清楚"的标准引用。⚠️ 教学级实现(非生产)、IEEE-CIS 同质数据族。与 反欺诈体系 的图算法教学相关。→ GitHub

10. 【威胁情报专题】Infrai astroturf 战役第 4/5 例:伪装内容升级为 Go 支付风控服务本身(今日同日新建(09-07)、同为 0★、同为 1 commit、同为 MIT、同为 Go 单二进制的两个仓库,README 均为 Infrai API 推广教程:① EthanBrooks6593/oauth-fintech-risk-gate-go——"帮 fintech 客户从 Auth0/NextAuth 迁移",INFRAI_API_KEY + Infrai {ok,data,error,metadata} 响应封套;② FletcherVance5389/risk-aware-payment-notifier——文件名即 infrai_realtime.go/infrai_realtime_test.go,POST /v1/realtime/publish。与 08-19 NilsBerg9082、08-28 ArjunPatel3961、09-04 MatsJohansson2781 三例 SMS API 教程同战役,累计 5 例【信号:★(威胁情报非工程参考)】)

风控视角:伪装策略的两次升级:其一,产品面从 SMS API 扩展到 realtime 推送 API(infrai_realtime.go);其二,也是最值得警惕的——伪装载体从"风控教程"升级为"风控服务代码":前 3 例是"用风控话题写 SMS 教程",今日两例是完整的支付风控 OAuth 门/通知服务(含表驱动测试、幂等 Idempotency-Key 设计说明),代码本身可运行、质量不差,对"只看代码质量"的筛选者是真实项目。这对本日报工作流是直接威胁:这类仓库未来会以更高置信度混过基于"README 是否推广第三方 API"的过滤——Infrai 键名/封套/llms.txt 三件套是当前最稳的指纹(两仓均带 llms.txt)。本条不为推广仓引流(仓库名已给出,勿注册其 API)。→ 判定依据:README 主叙事为 Infrai 能力介绍+INFRAI_API_KEY 接入,与 09-04 已确认的第 3 例同指纹。


技术趋势

  • "LLM 永不决策"第 6 跃迁:验证外移成三机制同日:协议级(aegis 的 MCP elicitation——"人类已批准"从 agent 自述变成协议事实,agent 的 confirm 标志被忽略)、网络级(aegis 的 CAMARA SIM-swap 预检——在人类被提示之前先问运营商)、工具级(kyc-aml 的 PEP——每次工具调用先过 policy.evaluate)。治理线(governor→证据 schema→代数钳位→跨域治理核→默认化→验证外移)的下一站是"信任的第三方化"。
  • 评估即证据链第 7 站:泄漏即 bug 报告:cher-ry 把 PR-AUC=1.00 定性为"bug 报告"并完整记录泄漏调查——比 09-04 的"自评 MIXED"更进一步:完美指标本身就是数据流程故障的告警器。
  • 保险理赔反欺诈首次入场:车险/健康险理赔垂直(dbt 特征层+44 数据质量测试+SHAP 平语化+类不平衡对照)补上追踪版图的第 6 个业务域(信贷/支付/电商/AML/社媒治理之后)。
  • "规则还是模型"出现可回放性锚点:abdullah risk-engine 为可解释+可回放明确放弃 ML,决策先于资金预留、行为状态带新鲜度门——GNN/XGBoost 流里的反潮流样本,面试论述的双面论据。
  • 语音反诈三通道融合:vericall 的声学伪造检测(AASIST)+家庭声纹白名单+LLM 话术风险对应三类独立证据层,"家庭声纹白名单"是个体化基线思路在语音域的落地。
  • 舆情风控的 LLM 已在自主决策:si126048 的 AI 审核代理自动批准/合并主题——内容风控里 LLM 决策线已被跨过(低风险信息操作),反证金融侧"永不决策"纪律的边界在资金与处罚动作。
  • Infrai astroturf 伪装载体升级:从 SMS 教程到可运行的 Go 支付风控服务——对"代码质量筛选法"的针对性规避。
  • arXiv 连续 41 期全噪声:新批次 2609.053xx/054xx(非缓存)仍 100% 域外,累计 844 条中 1 相关(99.9%)。

行业案例

  • GSMA Open Gateway / CAMARA 进 Agent 信任链:aegis 用 Nokia Network-as-Code 的 SIM-swap 状态做支付前校验——运营商网络信号商业化的真实落地
  • 英国 AML 合规栈:kyc-aml-multiagent 引用 POCA 2002 / MLR 2017 / FCA SYSC,KYC→EDD→SAR 路由
  • ABS Financial Systems 三服务编排:abdullah 的 ledger/orchestrator/risk 拆分+Pub/Sub+Cloud Run+Terraform+keyless CI
  • 中国反诈语音前线:vericall 的 AI 拟声电话诈骗拦截(独立开发)
  • 游戏行业舆情风控:si126048 以米哈游为示例的 7 平台采集+信度模型

值得深入

  1. aegis 的 ARCHITECTURE.md:elicitation 流程与 CAMARA API 调用链——"网络信号作为支付信任输入"的接口设计第一手样本。
  2. cher-ry 的泄漏调查章节:如何把"指标完美→怀疑泄漏→定位→修复→复测"写成工程叙事——评估文档写作的范本。
  3. kyc-aml 的 policy.py + mcp_server.py:工具调用边界的策略执行点最小实现(对照 virtualryder 的 Cedar 工具拒绝)。
  4. Imperator 的 applyInPandasWithState 用法:PySpark per-user 状态管理的可移植代码段(对照 Flink 版 sentinel-rto)。