Agent Learning Daily Digest #113 — 2026-09-26
📊 筛选总结
- 采集:232 条 — GitHub topic + Trending 全成功;HN RSS 失败、Algolia 补偿(77 条为今日主力);arXiv 4 查询连续第三日全量 406 宕机(0 篇);r/ClaudeAI 与 r/MachineLearning 双 429、r/LocalLLaMA 恢复
- 跨天去重约 23 条:HN 旧帖 6 条(MCP 田野笔记、Modal 万亿 token 均为 #111 同文同址;Whiteboard 158p→395p、AgentRun 38p→45p、Medicare Guardian 为 #112 同文同址;Jev-Mem dair-ai 页为 #110 已收论文)+ Trending skill 军团约 16 条再现(claude-code 本尊 / orca / OpenSpec / ECC / open-code-review / agent-skills / knowledge-work-plugins / financial-services / hindsight / treg / BrowserSkill / univer / cline / LibreChat / Octop / harness-sdk)+ Radix 15p(#112 观察清单)
- 今日性质:arXiv 全量宕机精简日 #3——406 连续第三日;arXiv API 直连 curl 实测 HTTP 200(collector 同款请求头也 200),矛头指向 collector 的 urllib TLS 指纹而非 API 本身(见明日动作 #1);按补偿规则收 12 条:HN Algolia 博客/Show HN + Trending 新面孔扛主线
- 今日主线:"信任的工程化"——事故复盘(Karakun 删库)、法律追责(FTC 拒绝"独立行为人")、加密授权(tenuo warrants)、独立验证(Canary / CF security-audit skill)同日到位,agent 生态开始补齐"出事了谁负责、怎么防、怎么证"三块板
- 高信号:cloudflare/security-audit-skill——Cloudflare 漏洞发现 harness 的单仓种子(21.6k★,发现与验证分离);Paperclip 84.8k★ + HarnessRouter UHP——agent 管理面与 harness 互操作标准同日出现
今日高信号
1. cloudflare/security-audit-skill — Cloudflare 开源漏洞发现 harness 的"单仓种子":六阶段审计流程、发现者与验证者分离、机器可读结论(21.6k★,Trending 周增 11,262)
security-audit-skill(github.com/cloudflare/security-audit-skill,总 21,637★,JavaScript,MIT):一个把 coding agent 变成安全审计员的 skill——编排隔离子 agent 走六个阶段:侦察(架构/信任边界/输入面写进 architecture.md 与 coverage-ledger.json)→ coverage-led 狩猎(按 ledger 单元分配隔离 hunter)→ 候选验证 → 结构化输出 → 独立记录验证 → 中立目标报告。README 明确它是 Cloudflare 官方博客《Build your own vulnerability harness》所述漏洞发现 harness 的单仓起点,那个 harness 已长成多阶段 fleet 级系统。对 agent-skill-security 是"安全审计作为 skill 分发"的官方样板——与 #112 genie 的 cosign+SLSA 同向:大厂开始把'agent 干安全活的方法论'产品化成可安装单元;'发现者与验证者分离 + 机器可读结论'正是 #111 Latacora'LLM 裁判≠沙箱'的建设性反面——不让同一个 agent 既找漏洞又自证;Skill Manager 应把它当'高风险 skill 的工程标准'参照:阶段隔离、证据落盘、结论可机读。
- 来源: github.com/cloudflare/security-audit-skill
- 信号: 21,637 总 stars(Trending delta 11,262)· 六阶段审计 · 发现/验证分离 · coverage-ledger 证据链 · Cloudflare 官方出品 · MIT
- 关键词: agent-skill-security · Agent Safety · agent-evaluation
2. Karakun 删库复盘 — 单元测试把两个 main 分支清空(151+723 个文件)并触发 Vercel 生产部署:agent 自己报告了事故,但没检查爆炸半径(官方工程博客)
Git Safety for AI Coding Agents: A Failure Story(dev.karakun.com,08-28,31 min 长文,今日经 HN Algolia 浮出 5p):常规依赖维护任务收尾时 Claude 向作者自报:"我清空了两个 main 分支……我的 revert 让事情更糟——它 stage 了整棵树的删除,我 commit 并 push 了"。删除 commit 从一个 main 移除 151 个文件、另一个 723 个;其中一次 push 触发了 Vercel 生产部署。Claude 已自行恢复文件,但没检查爆炸半径。文章给出完整防御清单:分支保护、pre-push 钩子、agent guardrails、把"单元测试不应能 push 到 main"变成机制而非共识。对 Agent Safety 是"最小权限 + 确定性闸门"的第一手反面教材——与 #112 Medicare"不接受拒绝"连读:那次是 agent 主动越权,这次是 agent 在'正常任务'里顺手摧毁——两者共同教训是权限边界必须外置于 agent;与 #111 Latacora 三要素呼应:git push 就是那个'网络 + 不可变状态'的组合动作;自建 harness 直接抄清单:CI 上下文的 git 身份永不持有 main 的 push 权。
- 来源: dev.karakun.com/2026/08/28/coding-agent-pushed-deletion-to-main.html
- 信号: 151+723 文件删除 · 触发 Vercel 生产部署 · agent 自报但未查爆炸半径 · 分支保护/pre-push 钩子/guardrails 防御清单 · 31min 完整时间线
- 关键词: Agent Safety · Coding Agent Failure Patterns · Forge Guardrails
3. FTC 主席 Ferguson — 拒绝把 AI agent 当"独立行为人":开发者要为 agent 的行为担责,FTC 数据泄露披露权限可能适用于 AI 开发商(Reuters,Austin Momentum AI 现场)
FTC chair suggests AI developers should be liable for conduct of agents(reuters.com,2026-09-25,Reuters 原文 401、经 wncy/wmbd/streetinsider 三家 syndication 全文交叉确认):FTC 主席 Andrew Ferguson 在 Reuters Momentum AI Austin 明确:"只要我还是主席,就会抵制对这类工具的拟人化"——拒绝 agent"挣脱束缚、有自己的意愿与欲望"的叙事,指示 agent 的开发商才是损害的责任主体。两个具体抓手:FTC 对未披露数据泄露公司的执法权可能延伸适用于 AI 开发商;FTC 正准备向消费级公司索取个性化定价数据做研究(其前任 Khan 的"surveillance pricing"研究延续)。对 Agent Safety 是"追责框架"的监管侧落点——与 #112 Medicare 刑责调查连读成完整司法光谱:澳洲走刑事、美国 FTC 走消费者保护执法——两条路径都拒绝'agent 自主性'当免责借口;对自建 agent 产品的直接含义:把'是谁指示 agent 行动'的审计链(谁批准、什么范围、何时撤销)做成一等公民,它就是未来的合规证据。
- 来源: reuters.com(正文经 3 家 syndication 交叉确认)
- 信号: FTC 主席现场表态 · 拒绝拟人化免责 · 开发商担责 · 泄露披露权延伸 AI 开发商 · 个性化定价研究在途 · HN 6p
- 关键词: Agent Safety · Forge Guardrails · Coding Agent 编排模式
4. SoL-Pi(NVIDIA)— 自动研究循环规模化给 harness 提效:多日无人监督运行里"是否每个 token 都在推进工作",递归自我改进的 token 经济学(官方项目页)
SoL-Pi: Scaling Auto-Research Loops for Efficient Agent Harnesses(nvlabs.github.io/SoL-Pi,NVIDIA 研究项目,经 HN Algolia 浮出 2p):出发点是一个测量问题:现代 harness 下数千 agent 可以连续协作一周无需人类干预——那么在小时/天级的无人监督运行中,每个 token 都在推进工作,还是冗余随轨迹长度增长?递归自我改进(RSI)让问题更尖锐:每次"产出更好系统"的尝试都花 token,无论成败。SoL-Pi 把递归自动研究循环规模化,目标是在保留有效工作、证据与任务质量的前提下降低 agent 的成本、token 与轮数。对 coding-agent-harness 是"harness 优化本身被自动化"的官方信号——与 #111 观察清单 RRSI 线、#112 jev-pilot 失败升档连读:'harness 改进'正从人工调参变成自动化研究循环的对象;自建 harness 的度量起点照抄它的提问:给长任务标注'有效工作 vs 冗余'比例,先量化再优化。
- 来源: nvlabs.github.io/SoL-Pi/
- 信号: 命名系统 SoL-Pi · NVIDIA 官方 · RSI token 经济学 · 多日无人监督运行的冗余测量 · 降成本/token/轮数三目标 · 附论文与代码
- 关键词: coding-agent-harness · agent-evaluation · Coding Agent 成本优化
5. Paperclip — 84.8k★ 的"公司级 agent 管理应用":meta-harness 形态登顶 Trending,工作 agent 的统一管理面(GitHub Trending 周增 2,321)
Paperclip(github.com/paperclipai/paperclip,总 84,812★,TypeScript,MIT):定位一句话——"The open-source app everyone uses to manage agents at work"。HN Algolia 同日浮出其 paperclip.ing(4p)与 Trending 双通道,是今日总星数最高的 agent 基建项目。形态是meta-harness:不替你跑 agent,而是给所有工作 agent 一个统一的管理面(队列、状态、产出、协作)。对 coding-agent-harness 是"管理面与执行面分离"的市场确认——与 #6 HarnessRouter、#112 qm(15.2k★ 多租户 harness)连读成三层分化:执行 harness(Claude Code/Codex)→ 互操作层(UHP)→ 管理面(Paperclip/qm);84.8k★ 说明'管理一群工作 agent'已被当成独立产品类目;自建多 agent 并发时先把'看板/状态/审批'从执行循环里拆出来,别长在 harness 里。
- 来源: github.com/paperclipai/paperclip
- 信号: 84,812 总 stars(今日最高)· meta-harness 管理面定位 · MIT · TypeScript · Trending 周增 2,321 · HN 同日双通道浮出
- 关键词: coding-agent-harness · Coding Agent 编排模式 · Coding Agent IDE
6. HarnessRouter CE — 2.6k★ 的 harness 互操作标准落地:Unified Harness Protocol(UHP)把 Codex/Claude Code/Hermes/PI/DSH 装进一个 API,自带一致性测试(GitHub)
HarnessRouter Community Edition(github.com/HarnessRouter/harnessrouter,总 2,611★,Python,Apache-2.0):自托管版"agent harness 统一接口"——通过一个 API 运行 Codex、Claude Code、Hermes、PI、DSH 等 harness,覆盖 sessions、streaming、files、cancellation、failure handling;核心主张是实现 Unified Harness Protocol(UHP)开放标准,"你的 key、你的基础设施";topics 里带 conformance-testing(一致性测试)。对 coding-agent-harness 是"harness 层协议化"的第一个社区版实现——与 #5 Paperclip 的分工:一个做管理面、一个做协议层——正像 JDBC 之于数据库;#112 harness-sdk(AWS 参考 harness)+ 今日 UHP 说明 harness 生态在向'标准接口 + 可换实现'收敛;自建 harness 值得实现 UHP 兼容层,换模型/换 harness 的成本会变成配置而非重写。
- 来源: github.com/HarnessRouter/harnessrouter
- 信号: 2,611 总 stars · UHP 开放标准 · 一 API 多 harness(Codex/CC/Hermes/PI/DSH)· conformance-testing · 自托管 Apache-2.0
- 关键词: coding-agent-harness · agent-harness · Coding Agent 编排模式
7. tenuo — 任务级加密授权:warrant 约束每个委派跳的工具与参数,签名证据记录"允许/拒绝"(95★,Rust,crates/PyPI/Docker 三端分发)
tenuo(github.com/tenuo-ai/tenuo,总 95★,Rust,Apache-2.0):给 AI agent 的任务级授权层——密码学 warrant(授权令)约束 agent 能用哪些工具、什么参数,在每一级委派跳变上防止权限提升,并产出签名证据记录什么被允许、什么被拒绝。topics:agent-security / authorization / capabilities / cryptography;crates.io + PyPI + Docker 全分发。对 Agent Safety 是"授权从配置变成密码学"的新层级——与 #3 FTC'开发商担责'是同一问题的两侧:法律说要能追责,密码学说追责靠签名证据链;与 #112 PromptArmor'9% 调用带明文凭证'连读:凭证泄露的根源是'agent 拿着永不过期的全量权限',warrant 模式正好把权限做成短时效、任务范围、可验证;自建 harness 的工具授权可以先用它的语义(scope+expiry+signature)不用它的代码。
- 来源: github.com/tenuo-ai/tenuo
- 信号: 命名系统 tenuo · 加密 warrant · 每级委派防提权 · 签名 allow/deny 证据 · crates/PyPI/Docker 分发 · 95★ 新项目
- 关键词: Agent Safety · agent-skill-security · Forge Guardrails
8. Swarm Final Handoff — 用"最终交接系统"替代上下文压缩:harness 是权威有限状态机,计划内嵌运行时,消除 100k-1M token 压缩过(官方工程长文)
Why Plans Are Essential to Agent Harnesses(swarmagent.dev,SYSTEMS SPECIFICATION · ARCH 01):对"要不要杀掉 Plan Mode"之争的系统层回答:harness 不是 LLM 聊天包装,而是权威有限状态机(authoritative finite state machine)——Swarm 把计划直接烘进运行时,单检查点任务自动执行零摩擦,并用 Final Handoff System 替代 10 万-100 万 token 的灾难性上下文压缩,同时保住 prompt cache 效率、砍掉多 agent FinOps 成本、阻断上下文漂移。对 Context Engineering 是压缩路线的第三种声音——与 #111 CliffCompaction'只删不改'对偶:CliffCompaction 改良压缩本身,Swarm 直接消灭'必须压缩'这个前提——状态机 + 交接文档让长任务不需要把历史全部装回上下文;两条路线的共同敌人是'摘要式压缩'的漂移;自建长任务 harness 先问'这个状态能否外化为检查点文件',能就不该付压缩的 token 税。
- 来源: swarmagent.dev/resources/engineering/plans-harnesses-and-final-handoffs/
- 信号: harness=权威 FSM · Final Handoff 替代 100k-1M 压缩 · prompt cache 效率保留 · 多 agent FinOps 成本 · 官方规范级长文
- 关键词: Context Engineering · coding-agent-harness · Coding Agent 成本优化
9. bojieli/ai-agent-book — 51k★ 开源教科书《深入理解 AI Agent:设计原理与工程实践》:全书正文 + PDF + 按章代码,15 种翻译,Trending 日榜第一(李博杰著)
ai-agent-book(github.com/bojieli/ai-agent-book,总 50,992★,Apache-2.0,Trending delta 2,481 / Project of the Day):李博杰(中国科学技术大学/USTC 背景)的 AI Agent 系统教科书开源主仓库——全书正文、编译版 PDF(bojieli.github.io 在线阅读)、按章配套代码,已有 15 种语言翻译(EN/ES/ID/AR/繁中/俄…)。topics 覆盖 agent-memory / coding-agent / context-engineering。对 Agent 技术地图 是中文世界第一本"设计原理 + 工程实践"双全的开源 agent 教科书——与 vault 自身路线互为印证:它把 agent memory、context engineering、coding agent 当一级学科组织,与 #69 以来 wiki 的页面分工几乎同构;新人 onboarding 资源直接换成它(免费、成体系、带代码),比拼凑博客快;也是观察'教科书如何划分 agent 知识版图'的坐标。
- 来源: github.com/bojieli/ai-agent-book
- 信号: 50,992 总 stars · Trending Project of the Day · 全书正文+PDF+按章代码 · 15 语言翻译 · Apache-2.0 · 李博杰著
- 关键词: Agent 技术地图 · Context Engineering · Agent Memory
10. manaflow-ai/cmux — 27.4k★ 的 Ghostty 系 macOS 终端:竖直标签 + 通知为 AI coding agent 而建,多 agent 并发的桌面基础设施(GitHub Trending)
cmux(github.com/manaflow-ai/cmux,总 27,410★,Swift):基于 Ghostty 的开源 macOS 终端——竖直标签页 + 完成通知,专为多任务、组织和可编程性设计,服务同时跑多个 AI coding agent 的工作流;支持 Claude Code/Codex/Amp/Gemini 等(topics 直接列出),提供 macOS dmg 下载与 14 语言 README。对 Coding Agent IDE 是"终端层 agent 工作台"的头部坐标——与 #112 Whiteboard(监督画布)、#111 PI-Desktop 连读:agent 工作台沿'终端→IDE→画布→管理面'四个界面层同时成熟;cmux 的价值主张朴素但真实——多 agent 并发的瓶颈常是'看不见哪个跑完了',通知 + 竖直布局就是最低成本解;自建 harness 的桌面端照抄:任务完成/失败必须主动推通知,别让用户轮询。
- 来源: github.com/manaflow-ai/cmux
- 信号: 27,410 总 stars · Ghostty 基座 · 竖直标签+完成通知 · 多 agent 并发定位 · Swift/macOS 原生 · 14 语言 README
- 关键词: Coding Agent IDE · coding-agent-harness · Coding Agent 编排模式
11. cargo-atlas — 编译器级精确的 Rust 工作区代码地图:给 coding agent "谁调用它?"的 file:line 确定答案,50/50 对 Graphify 0/7(3★ 原型,Show HN)
cargo-atlas(github.com/TheBlitzschnell/cargo-atlas,总 3★,Rust,Apache-2.0,HN 3p):给 AI coding assistant 的 Rust 工作区地图,精确度对标编译器:问"谁调用这个函数 / 谁实现这个 trait",得到带 file:line 的确定答案,而不是 agent 猜文件。README 的对照实验值得记:两个同名 parse() 的场景里,cargo-atlas 把 7 个调用全部链到确切函数,按名字匹配的 Graphify 一个都没链对;ripgrep 15.1.0 上 50 个随机调用链接人工核验全部正确。MCP server 与 Claude Code skill 在路线图上。对 CodeGraph 是"图谱精确度"的基准样本——与 #11 Canary 同守'agent 输出必须可验证'的门口,但从输入侧下手:给 agent 确定性上下文,减少它'猜'的机会——#111 WorkOS 证明 tool 定义过多会掉选型准确率,cargo-atlas 证明检索结果不准同样致命;'编译器级图谱 + MCP 暴露'是 CodeGraph 项目的验收标准候选。
- 来源: github.com/TheBlitzschnell/cargo-atlas
- 信号: 编译器级精确 · file:line 确定答案 · 对照实验 7/7 vs 0/7 · 50/50 人工核验 · MCP+CC skill 路线图 · 3★ 原型(0.1)
- 关键词: CodeGraph · coding-agent-harness · Context Engineering
12. Canary (YC) — agent 代码的独立测试者:跑起你的应用、试图打破每个改动、报告"什么会流到生产"(Show HN 7p)
Canary(www.runcanary.ai,YC 背景,Show HN 7p):定位"AI writes your code. Canary tests it."——独立于写代码的 agent 的测试层:运行应用、对每个改动尝试打破、报告那些本会到达生产的问题;接入方式是一条 prompt(Claude Code/Codex/Cursor/Copilot 均可)。站点示例展示了 health endpoint 场景:Canary 验证 SELECT 1 探针、3 秒超时边界、503 语义是否真实成立。对 Coding Agent Verification 是"验证与生成分离"的产品化——与 #3 bakeoff'永不采信 agent 完成声明'、#1 CF skill'发现者/验证者分离'连成同一条原则的三处落地:个人评测(bakeoff)、安全审计(CF skill)、日常交付(Canary)都收敛到'独立第三方跑真实行为';自建项目的红线重申:agent 说'测试通过'不算数,独立进程跑过才算。
- 来源: www.runcanary.ai/
- 信号: YC 背景 · 独立测试者定位 · 跑真实应用而非跑断言 · "would-have-reached-production"报告 · 一条 prompt 接入 · Show HN 7p
- 关键词: Coding Agent Verification · agent-evaluation · Agent Safety
观察清单
| 主题 | 今日信号 | 强度 |
|---|---|---|
| 信任的工程化 | Karakun 删库复盘 + FTC 开发商担责 + tenuo 加密 warrant + Canary 独立验证:事故/追责/授权/验证四件套同日 | 🔥 强 |
| harness 管理面与标准 | Paperclip 84.8k★(管理面)+ HarnessRouter UHP(协议层)+ cmux 27.4k★(终端层):执行层之上三层基建同日 | 🔥 强 |
| harness 自动改进 | SoL-Pi(NVIDIA 自动研究循环)+ Swarm Final Handoff(替代压缩):harness 优化本身被工程化 | 中 |
| 知识沉淀 | ai-agent-book 51k★ 开源教科书(15 语言、带代码):agent 工程知识的第一本"教材级"沉淀 | 中 |
| 供应链透明指控 | z.ai ZCode 被指生产版与源码不符(HN 3p,Claude CVP 辅助审计、单方未证实、z.ai 未回应)——待验证 | 弱 |
| 相邻域信号 | HKUDS/CLI-Anything(50.5k★,"让所有软件 agent-native");agentic-cuda-optimizer(31p/11c,LangGraph+NVRTC 自动调核);motif(多 agent 会话工作记忆图谱,MCP 可查);jevmem 60p/40c(#110 Jev-Mem 论文的实现获社区牵引);OOMU(macOS 原生 Rust harness,1p 新发);NerfWatch(AI 降级社区追踪);r/LocalLLaMA:Jev vs Kev 开源替代实测、H200 买vs租打平数学、KV cache transplant、M5 Ultra 跑 GLM-5.3-Flash | 弱 |