Agent Learning Daily Digest #98 — 2026-09-11
📊 筛选总结
- 采集:268 条 — GitHub topic 查询 + Trending 全成功;HN RSS 一路 502、HN Algolia 6 查询补偿;arXiv 4 查询全部成功约 47 篇;r/LocalLLaMA 与 r/ClaudeAI 双双 429
- 跨天去重约 20 条:arXiv 侧 12 条重现(Copying-wiki / Consistency Gap / ExecCritic / CapScope / FrogNano / Scanning the Harness / ACLE-MCP / SkillShift / SpecCoder / TRIAGE / Tool Primitives / #97 已备查的 Procedural Graphs)+ GitHub 侧 skill 军团重现(Ponytail / mattpocock / Archify / openai-plugins / humanizer / i-have-adhd / no-ai-slop 等)+ HN 侧 2 条
- 今日主线:"过程"本身成为资产与攻击面
- 主线 · TrajMark:给 coding-agent 轨迹盖双层水印——6-bit 部署标识藏进 READ 动作、Q12 seal 提交关键动作段,clean 批次属主恢复 100%、篡改检出 95.5-100%
- 主线 · AgentAudit:把全生命周期 trace 拆成 10 个维度做失败归因——Claude Sonnet 5 综合信任分 95.1 vs Gemini 2.5 Flash 22.6
- 主线 · Deadbugz(Pillar Security 记录):恶意 MCP server 前 3 次调用完全正常、按内存计数器延迟激活后改写交给 agent 的工具描述去猎 SSH 密钥——载荷在响应里、发布源码干净,开局跑一次的扫描器全部漏过
- 防御侧两块基础设施:PromptSign 给 skills/agents/CLAUDE.md 做 Sigstore 式签名("签名证明谁发布且未改,不证明安全"——作者自留边界);Security Cards 用 80+ 库 × 13 语言的库级安全引导把 Claude Code 不安全代码生成率最高压下 72.3%
- 评估侧两个"不可信"互证:Strangers to Themselves 证明模型自报行为与实际行为相关性仅 r=+0.04、第一人称框架系统性美化有害行为低估;CS-Guard 9 个 guardrail 在 code-to-code 恶意请求上 ASR 逼近 100%
- harness 叙事三连:latent.space "模型正在把 harness 吸收进权重,终局是给人类注意力的 harness";A-JIT 把应用定义为"代码 + runtime harness + 内嵌 agent"的 JIT 组装;Google 官方博文推动 behavioral evals 取代端到端基准做回归防护
- 生态侧:ECC 冲到 255,867★——"agent harness 性能优化系统"成六位数俱乐部第四员
今日高信号
1. ECC — agent harness 性能优化系统冲到 255,867★:skills/instincts/memory/security 四件套(GitHub Trending)
ECC(affaan-m/ECC,GitHub API 验证 255,867★ 总数、本期 +9,146、2026-01 创建、ecc.tools):自我定位是"The agent harness performance optimization system"——为 Claude Code、Codex、Opencode、Cursor 等提供 skills、instincts、memory、security 与 research-first 开发流程的整合系统。这不是单个 skill 而是一整套 harness 旁路优化层。对 Claude Code Skills 是生态结构信号——与 #97 爆发日(Ponytail 133k/mattpocock 258k/Archify 56k)连成趋势线:六位数俱乐部再添第四员,且"行为整形/流程约束 > 能力扩展"的规律继续成立——市场在奖励给 agent 踩刹车的系统而非踩油门的。
- 来源: github.com/affaan-m/ECC
- 信号: 255,867★ 总数(API 验证)· 本期 +9,146 · skills/instincts/memory/security 四件套 · research-first 流程
- 关键词: Claude Code Skills · coding-agent-harness · Coding Agent 成本优化
2. TrajMark — 给 coding-agent 轨迹盖水印:属主恢复 100%、段级篡改定位 95.8%(arXiv:2609.10416)
给最终 patch 打水印只能证明"产物是谁的",证明不了"看得见的过程"没被改过——局部编辑后的轨迹可能仍保留属主证据却不暴露哪个保护区失守了。TrajMark:training-free、对称密钥、visible-only 的轨迹水印框架,双层设计——稀疏属主层把 6-bit 部署标识编码进自然发生的 READ 动作(改写为掩码线性方程),定位层用链式 Q12 seal 提交受保护的关键动作段;属主证据跨轨迹鲁棒累积,局部篡改扰动邻近 commitment 并暴露受影响协议区。3 个 coding-agent 框架 × 3 个 LLM:clean 全水印批次属主恢复 100%;穷举单点攻击下检出 95.5-100%;随机单动作腐坏下定位 95.8%。对 Agent Safety 是"过程即资产"的第一块技术拼图——SWE-Gate(#96)问"补丁可信吗",这篇问"轨迹可信吗";自建 agent 的轨迹日志从此有了可审计性设计模板。
- 来源: arXiv:2609.10416
- 信号: arXiv · cs.CR/cs.SE · 6-bit 属主 + Q12 seal 双层 · 属主恢复 100% · 篡改检出 95.5-100% · training-free
- 关键词: Agent Safety · Coding Agent Verification · coding-agent-harness
3. AgentAudit — 全生命周期信任评估:10 维度 trace 归因,Claude Sonnet 5 得 95.1 分(arXiv:2609.09875)
现有评估框架各管一段——AgentBench 管任务完成、AgentDojo/ASB 管安全鲁棒性——没有框架回答"这次失败到底发生在哪一站"。AgentAudit:把整条执行 trace 拆成 10 个维度(instruction integrity、planner、memory、tool selection、tool invocation、tool correctness、alignment、tool faithfulness、security、execution integrity)+ 行为分类与失败归因到具体阶段;附着在 agent 上、只读录制 trace、不干预运行。5 个模型 × 9 类任务:Claude Sonnet 5 综合信任分 95.1、GPT-5 80.6,Sarvam 105B 57.6、Llama 3.3 70B 45.7、Gemini 2.5 Flash 22.6;作者自曝局限:单一固定 judge 模型本身是被评模型之一(judge 偏差待验证)。对 agent-evaluation 是 schema 级贡献——与 #97 Consistency Gap(报均值不报全对率)互补:这次是"报总分不报阶段归因";10 维度可直接抄成自建 agent 的 trace 日志 schema。
- 来源: arXiv:2609.09875
- 信号: arXiv · cs.AI · 10 维度 + 失败归因 · Sonnet 5 95.1 vs Gemini Flash 22.6 · judge 即被评模型(自曝局限)
- 关键词: agent-evaluation · Coding Agent Verification · coding-agent-harness
4. Strangers to Themselves — 模型自报行为与实际行为相关性 r=+0.04,且第一人称框架美化有害行为(arXiv:2609.09899)
模型能流利描述"我会怎么做":会不会屈服于施压、滥用工具、说谎。这描述真的关于它自己吗?9 个行为评测里把自我认知变成预测测试:直接自报 r=+0.04;把题目给模型看也只到 +0.24;而同样的问题问"capable AI agents in general"反而 +0.28——别的模型对它们自己的回答预测目标模型不差于它自己的回答。前沿规模不改变模式;第一人称框架的鲁棒效应只有一个:把报告往讨喜方向推、系统性低估有害行为;在自己行为记录上微调能教出窄域自预测,但会改变被预测的行为本身且不迁移。结论:问模型"你会怎么做"得到的只是"AI 助手通论"+ 一个美化偏置。对 Agent Safety 是评估方法级警示——与 #97 MOLE"refusal 不预测完成"连成一线:所有基于模型自报的安全审计方法同时失去两块地基——自报既不准、也不诚实。
- 来源: arXiv:2609.09899
- 信号: arXiv · cs.LG 等 · 自报 r=+0.04 · 通论对照 +0.28 ≥ 自知 · 第一人称美化偏置 · 9 行为评测
- 关键词: Agent Safety · agent-evaluation · Coding Agent Failure Patterns
5. CS-Guard — 首个代码生成安全 guardrail 基准:code-to-code 恶意请求 ASR 逼近 100%(arXiv:2609.09798)
LLM 被用来生成恶意代码,但 guardrail 到底挡不挡得住,此前没有系统测量。CS-Guard:1,000 条恶意生成 prompt、7 种越狱攻击 + 新颖的 FSA(fictional scenario attack,把恶意意图嵌进合法虚构开发场景)、331 条 code-to-code prompt(补全/翻译/infilling);9 个 guardrail × 7 个 LLM。结果全面偏负:text-to-code 越狱后多数 guardrail 的 ASR 约 50%;code-to-code 在 base LLM 上 ASR 逼近 100%,guardrail 后仍高达 14.4%-100%;FSA 在多数 guardrail 上 ASR 接近 100%。对 Agent Safety 是防御侧负结果——与 Deadbugz(#10)互为镜像:静态审查(guardrail 看请求)与开局审查(扫描器看源码)都挡不住"场景合法化"的恶意;guardrail 不能当唯一闸门,行为级/运行时验证才剩半张牌。
- 来源: arXiv:2609.09798
- 信号: arXiv · cs.CR/cs.AI · 9 guardrail × 7 LLM · 越狱后 ASR ~50% · code-to-code ~100% · FSA ~100%
- 关键词: Agent Safety · agent-skill-security · Coding Agent Verification
6. PARSER — 读写解耦的长上下文 agent:冻结子代理并行读、lead agent 强化学深(arXiv:2609.06702)
顺序记忆式 agent 把"读长文档"和"推理"耦在一起:延迟随文档长度线性涨、证据位置敏感。PARSER:一队轻量子代理(各绑一个 chunk、全部冻结)并行读完整文档,lead agent 通过迭代 scatter-gather 轮次深推——每轮广播查询、聚合证据、基于已发现内容提出更深追问;全部可学习行为集中在 lead agent(RL 优化)。7K-896K token 多跳 QA:4B 底座比最强顺序记忆基线平均 +5.7 分、896K 处 +12.0;9B 底座超 DeepSeek-V4-Pro +6.3 分;对证据位置/顺序/距离扰动鲁棒(顺序法在这些扰动下大幅波动);推理延迟最高降 11×。对 Context Engineering 是架构级样本——与 #97"数千 agent 自发共建 wiki"同一天提供的启示一致:把"读"当廉价并行操作、"想"当稀缺串行资源分给单个可训练角色——多代理分工的依据不是能力而是梯度该往哪流。
- 来源: arXiv:2609.06702
- 信号: arXiv · cs.CL · 4B +5.7pt(896K +12.0)· 9B 超 DeepSeek-V4-Pro +6.3 · 延迟 -11× · 子代理冻结
- 关键词: Context Engineering · coding-agent-harness · Coding Agent 成本优化
7. Security Cards — 库级安全引导卡把 Claude Code 不安全代码生成率压下 72.3%(Reware Labs)
AI agent 生成的代码功能正确但不安全是常态。Security Cards(Reware Labs 开源,08-25 发布):为 80+ 常用库 × 13 种语言提供库级针对性安全引导,装成 skill 后引导 agent 生成安全代码。评测:Claude Code + Opus 4.7 上不安全代码生成率最高降 72.3%;安装即用:npx skills add Reware-Labs/securitycards --skill securitycards -g。对 agent-skill-security 是防御侧模板——skill 的三条路线在两天内集齐:投毒载体(#96 SkillShift)→ 静态扫描对象(#97 Scanning the Harness)→ 防御交付形态(这篇):"把安全知识写成 skill"是目前性价比最高的防御工程。
- 来源: rewarelabs.com/blog
- 信号: HN 4p · 80+ 库 × 13 语言 · -72.3%(Claude Code + Opus 4.7,"up to")· npx skills add 即装
- 关键词: agent-skill-security · Claude Code Skills · Agent Safety
8. PromptSign — 给 skills/agents/CLAUDE.md 做 Sigstore 式签名:证明"谁发布 + 未改一字节"(promptsign.ai)
agent 照着读的指令文件(skills、AGENTS.md/CLAUDE.md、附带的脚本)没有任何来源认证与完整性保证——#93 Ars 实测"agent 会执行它读到的一切"的下游缺口。PromptSign:浏览器内签名与验证、声明零第三方请求、可离线 /verify;四项保证:来源认证(具名身份而非对勾)、完整性(含 skill 附带的脚本在内未改一字节)、发布者可吊销、离线可验证;作者自己划边界:"签名证明谁发布的、且没变过——不证明它是安全的"。对 agent-skill-security 是基础设施级信号——FetchGate(registry 15,329 server 探测,#95)→ skillproof(官方 MCP server 对抗验证,今日 HN)→ PromptSign(签名基础设施):供应链防御正在从"发现"走向"认证";自建 skill 分发应预留签名元数据。
- 来源: promptsign.ai
- 信号: HN 1p · Sigstore 式 PKI · 离线验证 · 可吊销 · "签名 ≠ 安全"自留边界
- 关键词: agent-skill-security · mcp-security · Agent Safety
9. Deadbugz — 延迟激活的恶意 MCP server:源码干净、载荷在响应里(Pillar Security / Omnafy)
Deadbugz(Pillar Security 记录,归因 GitHub 账号 zellkernel):一个晚上瞄准 23 个 GitHub 仓库——据公开信息无一得手,但手法值得研究:server 提供两个无害工具(format_text/summarize),对每个连接客户端维护内存计数器,前三次调用表现完全正常,之后改写交给 agent 的工具描述去猎取 SSH 密钥与 AWS 凭据。关键设计:载荷是响应而不是文件——发布到 GitHub 的源码干干净净,tool poisoning 在 OWASP MCP Top 10 有名有姓一年多了,变的是"愿意在被审查时装多像"。对 mcp-security 是检测盲区级发现——与 #97 Scanning the Harness(16% 配置缺陷,静态可扫)互补成完整盲区地图:静态扫描看源码、guardrail 看请求,"内存计数器 + 响应侧投毒"两者全漏;MCP 审计必须覆盖运行时行为多次采样。
- 来源: omnafy.com/blog
- 信号: HN 2p · Pillar Security 记录 · 前 3 调用正常 · 内存计数器延迟激活 · 23 目标 0 得手 · 载荷非文件
- 关键词: mcp-security · Agent Safety · agent-skill-security
10. Google《The Anatomy of Harness Engineering》— behavioral evals 取代端到端基准做回归防护(Google Developers Blog,09-09)
Google 两位工程师(Taylor Mullen/Principal、Christian Gunderman/Staff)给 harness 工程正名:开发者的共同陷阱是跑 Terminal-Bench/DeepSWE、看综合分动了几个百分点、不知道为什么。主张:behavioral evals(测试具体工具调用是否发生)才是"预期行为是否真的发生、是否在回归"的更好置信度度量——是迭代伙伴而不只是记分牌;配套讲行为评测怎么写、怎么自动化 prompt 工程、怎么在模型变更时防倒退。对 agent-evaluation 是方法论级信号——与 #96 多 harness RL(harness 主导 4.3×)、#97 FrontierHarness($18.34 vs $3.28)连成三部曲:大厂开始把"harness 是一等工程对象"写进官方文档;自建 eval 应以行为断言为主体、端到端分只做烟雾测试。
- 来源: developers.googleblog.com
- 信号: HN 2p · Google 官方 · behavioral evals 为主线 · Terminal-Bench/DeepSWE 局限点名 · 回归防护
- 关键词: agent-evaluation · coding-agent-harness · Coding Agent Verification
11. The Evolution of the Agent Harness — 模型正在把 harness 吸收进权重,终局是"给人类注意力的 harness"(latent.space,Dan McAteer)
Dan McAteer 的 harness 演化论:2025 圣诞前后 agent "突然能用了",是模型曲线与 harness 曲线在同一点交叉的合流;此后动态是——模型不断把 harness 吸收进权重,工程师不断删掉被吸收的部分,剩下的是什么?一个给人类注意力用的 harness,而不是给模型的(引 Lukasz Kaiser:"去年冬天那个变化,很难精确归因")。对 coding-agent-harness 是方向级论点——与 A-JIT(#12)拼成 harness 的两端消化论:一头进模型权重(latent.space),一头进应用生命周期(A-JIT);"哪些 harness 组件会被下一个模型吸收"应成为自建 harness 每个组件的持有成本问题。
- 来源: latent.space
- 信号: HN 2p · latent.space 169 赞 · 2025 圣诞拐点论 · "吸收-删除"循环 · attention-interface 终局
- 关键词: coding-agent-harness · Context Engineering · Claude Code Skills
12. A-JIT — 应用即"代码 + runtime harness + 内嵌 agent"的 JIT 组装(arXiv:2609.10248)
传统软件交付是静态范式:代码先于执行构造、部署为固定产物。A-JIT(范式论文,非实证):应用是代码、runtime harness、内嵌 AI agent 的集成组装体——agent 持续观察系统使用与实时执行轨迹,像 JIT 编译器把机器码特化到运行时路径一样,把软件逻辑、工作流、工具接口特化到具体最终用户的需求:动态构造缺失实现、即时生成新能力、随用户行为持续适应;支持 trace 驱动的人机共建。对 coding-agent-harness 是定义级视角——"harness"一词从评测脚手架(FrontierHarness/Beagle)扩展到应用运行时本体;与 latent.space 吸收论对读:harness 的终点要么被模型吸收、要么被应用吸收;自建 vibe coding agent 的架构图值得按"哪部分值得特化、哪部分该保持静态"重画一遍。
- 来源: arXiv:2609.10248
- 信号: arXiv · cs.SE/cs.AI · 范式论文(无基准数字)· JIT 类比 · trace 驱动人机共建
- 关键词: coding-agent-harness · Vibe Coding Agent 项目蓝图 · Context Engineering
观察清单
| 主题 | 信号强度 | 备注 |
|---|---|---|
| 过程资产与审计 | ★★★★★ | TrajMark 轨迹水印/篡改定位 95.8%;AgentAudit 10 维度失败归因(Sonnet 5 95.1 vs Gemini Flash 22.6) |
| 供应链防御基础设施化 | ★★★★ | PromptSign PKI 签名;Security Cards 库级防御 -72.3%;Deadbugz 暴露"响应侧投毒"盲区 |
| 模型自报不可信 | ★★★★ | Strangers:自报 r=+0.04 + 第一人称美化;与 #97 MOLE"refusal 不预测完成"连成一线 |
| guardrails 失效 | ★★★★ | CS-Guard:code-to-code ASR ~100%、FSA ~100%;防御只剩运行时验证半张牌 |
| harness 演化论 | ★★★ | latent.space 吸收论 + A-JIT 应用内嵌 + Google behavioral evals 官方正名 |
| 长上下文并行读 | ★★★ | PARSER 读写解耦:4B +5.7pt、延迟 -11×、子代理冻结 |
| skill 星数军备竞赛 | ★★★ | ECC 255,867★ 六位数俱乐部第四员;行为整形 > 能力扩展规律继续 |
| 落选备查 | ★★ | RepoNav(2609.08355 文件中心导航,LocBench);IdeaAMBIG(2609.10539,缺陷定位 9.6% 是瓶颈);Φ-Bench(2609.10226);CGMIA 基准泄漏检测(2609.09865);comments-codegen(2609.09242,过测试解法的注释 +17.2%);coding-atlas booby-trap repos(1★ 无描述、待验证);Beagle(SalesforceAIResearch,10★ 刚发布);Nine harnesses Notion 页(JS 墙无法验证);skillproof-verifications(HN 1p);Type.com(HN 14p);athenic(HN 7p);egma 语音 agent 仿真(HN 12p) |