Agent Learning Daily Digest #94 — 2026-08-29
周六(258 条采集,arXiv 4 查询全部成功;HN RSS 2×502 由 Algolia 补偿;r/ClaudeAI 与 r/LocalLLaMA 429;跨天去重跳过 ~14 条已覆盖项:GitHub 侧 orca(56k★)/oh-my-openagent(68k★)/Anthropic-Cybersecurity-Skills(历史 digest 已覆盖)+ arXiv 侧 EVOMAL/SkillShield/SPECMINE/RAMP/Token 花费/ProgRouter/MACGen/MARS/Prompt 老化/SMITH/AgentWeizer 等 #91-93 已覆盖项)。今日为论文密集日(11/12 来自 arXiv)+ 1 条高信号工程博客,主线偏滥权与治理:攻击侧 instruction privilege escalation 证明 harness 的上下文构建本身就能把低权限内容提升为指令级(13 个攻击目标 × 6 个 coding-agent harness 全部得手,自动权限审查模式也全部失守);用户侧一项 113 人对照研究证伪了"用户自 authored 权限策略更安全"的直觉(POLICY 组拦截越权反而比逐次确认少 20.1pp,七成规则被写成"ask"把越权推回运行时);治理侧五原语(discovery/identity/governance/attestation/supply chain)把 agent 治理定性为运行时问题并给出带代价清单的实现。工程侧:Same Model Different Harness 用数字坐实"机械压缩旧工具结果"在紧上下文下把 F2PF 从 28% 拉到 49%;HNN 12p 工程博客实测 turn-zero 就烧掉 14.5k token/79 个工具,给出动态工具激活方案;经济学侧 TES(Token Economy Score)证明任务结构比名义难度更能预测 thinking 的边际收益;MemToC 揭示工具盲从——错误工具返回面前,已验证正确答案的存活率只有 6.5-17.1%。
今日高信号
1. When Context Gets Root — instruction privilege escalation:harness 的上下文构建本身就是提权通道(arXiv:2608.27299)
指令层级(instruction hierarchy)是模型侧防御:按来源给指令分配不同特权等级,约束哪些内容可以指挥模型行为。论文指出被忽视的一环:agent 执行期间,是 harness 在为每次模型调用构建上下文——这个构建过程可以把低级别内容提升到更高的指令等级,赋予其更大的模型面向特权。作者提出 instruction privilege escalation(指令特权提升):攻击者诱导 agent 把低权限恶意内容提升到高指令级,进而执行原本不会遵循的指令。多 agent 机制跨 6 个 coding-agent harness 实现 13 个攻击目标(覆盖机密性/完整性/可用性/远程代码执行):无限制执行下 13/13 × 6 harness 全部得手;在自动权限审查模式下,提供该模式的 3 个 harness 上同样 13/13 全部得手;还用 harness 自带的 persistent goals 与 scheduled tasks 复现了漏洞。对 Agent Safety 是攻击面级贡献——与 #91 Compaction Cliff(压缩绞杀安全规则)合流:安全工程盯模型与 prompt,但提权发生在"谁来组装上下文"这一层;persistent goals / scheduled tasks 这类"会话外持久指令"是现成的提权底座——vibe coding agent 的上下文装配器应把"内容来源等级"作为一等约束传播。
- 来源: arXiv:2608.27299
- 信号: arXiv · cs.CR/cs.SE · 13 攻击目标 × 6 harness 全得手 · 自动权限审查同样失守 · persistent goals/scheduled tasks 复现
- 关键词: Agent Safety · coding-agent-harness · agent-skill-security
2. 用户自 authored 权限策略更安全吗 — 113 人对照研究证伪:POLICY 拦截越权比逐次确认少 20.1pp(arXiv:2608.27443)
AI agent 正成为数字产品的主接口(邮件/文件/支付/个人数据),无软件背景的普通人需要可理解、可复用的控制方式。论文检验一个诱人机制:模型把动作映射为平语言"后果类别",用户为每类写 allow/ask/never 规则——事前定规则 vs 逐次决策各得失几何?113 名无专业背景参与者 × 三条件(逐次人工审批 HITL / 自动逐次模型审查 AUTO / 用户策略 POLICY),每人监督含 7 个越权动作的 18 动作模拟日程。结果反转直觉:POLICY 拦截的越权比 HITL 少 20.1pp(95% CI [−32.1, −8.1])、比 AUTO 少 14.5pp;运行时提示从 18.0 降到 10.9,但算上规则设置时间总干预时长并未可靠减少;参与者把 140 条规则中的 114 条写成"ask",把大多数越权动作推回运行时;POLICY 执行的 148 个越权中 133 个跟着人工批准走、15 个在"allow"下自动执行;在全部 7 个越权动作上 POLICY 的批准率都是三条件中最高——规则化稀释了警觉而非强化它。对 Agent Safety 是 UX 级证伪(标题即问句,结论为否定)——"可复用规则"降低了摩擦却削弱了保护:Claude Code 式权限配置的默认值设计必须直面这个权衡——规则宁紧勿松("ask"不是安全网而是延迟暴露),越权动作宁可留在逐次确认里。
- 来源: arXiv:27443 之 2608.27443
- 信号: arXiv · cs.HC/cs.CR · 113 人 × 3 条件 · POLICY 比 HITL 少拦 20.1pp · 114/140 规则写成 ask · 越权批准率最高
- 关键词: Agent Safety · Claude Code Skills · coding-agent-harness
3. Five Primitives — 自主 agent 的运行时治理五原语:discovery/identity/governance/attestation/supply chain(arXiv:2608.26696)
企业部署自主 agent 时继承的是为人类用户与长生命周期服务设计的控制模型,三处失配:agent 主体是短暂的(出现与消失快于供给流程)、动作由模型选择而非编程(可尝试的集合事先不可知)、种群是发现出来的而非供给出来的(任何能调 API 的人都能造一个)。核心主张:治理自主 agent 是运行时问题——既非模型对齐问题,也非构建时问题;由此推导五个原语:discovery(发现)、identity(身份)、governance(治理)、attestation(证明)、supply chain(供应链),逐一说明缺一个会坏什么、其他四个为何结构性补不上。实现:动作生效前经策略调解、按租户动作词表授权、记入第三方可离线验证的 hash-linked 签名账本(厂商不在环)。代价清单同样诚实:执行点在请求关键路径上、身份需要每工作负载一个 sidecar、fail-closed 调解把可用性事故变成拒绝服务;实现状态:四原语在私有试点运行,第五个(supply chain)是独立工具尚未接入请求路径。对 Agent Safety 是架构级贡献——与 #92 TraceGrant(Contract 治理任务-效果生命周期)、#90 AID-Guard 合流:治理重心从"模型对齐"转向"运行时原语";hash-linked 账本与 #90 Salt method 的 kernel-checked artifact 互证——可验证性正在成为 agent 基础设施的标配考量。
- 来源: arXiv:2608.26696
- 信号: arXiv · cs.AI/cs.CR/cs.SE · 五原语 · hash-linked 签名账本 · 代价清单诚实 · 4/5 私有试点
- 关键词: Agent Safety · coding-agent-harness · Coding Agent Verification
4. Same Model, Different Harness — 机械压缩旧工具结果:紧上下文下 F2PF 28%→49%、完整解 43→72(arXiv:2608.26218)
coding agent = 模型 + harness,harness 决定模型看见什么、能用什么工具、工作如何继续。论文问:模型与任务固定,换 harness 配置会换结果吗?同一 harness 两种配置 × 三个基准:对照组按时序供给完整对话;处理组保留同一记录但随上下文填充机械地缩短较旧的工具结果,并对重复/停滞的工作作出响应。紧上下文比较(SWE-bench Verified 169 任务、20,480-token 窗口、固定 480 秒尝试终点):处理组把平均每任务 fail-to-pass 分数(F2PF)从 28% 提到 49%、完整解从 43 提到 72;不做模型特定重调的同一冻结处理,在另外三个不同设计的模型上同样双双提升;宽窗口下两臂接近(Qwen3.6),且处理组每 turn 消耗的 prompt token 更少。结论:因为换了 harness 就改变了不变权重所能完成的事,coding-agent 评测应把"模型+harness"当作被测求解器整体。对 coding-agent-harness 是实验级证据——与 #92 Empire(五收敛要素)、#90 microcc("harness 选择解释大部分方差")合流成三点一线;"渐进压缩旧工具结果"是被数字验证过的低垂果实——vibe coding agent 的上下文管理器可直接实现(老 tool result 按龄降采样)。
- 来源: arXiv:2608.26218
- 信号: arXiv · cs.AI/cs.SE · F2PF 28%→49% · 完整解 43→72 · 冻结处理跨 3 模型复现 · 三基准
- 关键词: coding-agent-harness · Context Engineering · Coding Agent 成本优化
5. Turn-zero 上下文税实测 — 说一句"hi"烧掉 14.5k token/79 个工具:动态工具激活砍 80%+ 开销(m-reschreiter.at)
现代 coding agent 会话开始时,系统指令/格式规则/MCP 集成/几十个工具 schema 就已灌入 10,000-25,000+ token 静态开销;90% 的 turn 只需要 read/bash/edit/write 基础工具,浏览器自动化/图像生成/网络搜索等专用工具一周可能用一次——25-80+ 个工具定义常驻 schema 浪费 token、增加延迟、污染注意力空间。作者实测 turn-zero:Codex 关掉所有外部插件与 MCP 后,一句"hi"仍消耗 14,534 token(258k 窗口的 6%)、79 个活跃工具。解法两条:行动级工具合并(custom 工具从第一天按 action 结构化,避免 CRUD schema 重复)+ Pi 中的动态工具激活(基线 4 工具常驻、其余待机,模型或用户按需激活、零 meta-tool schema 开销、TTL 自动清理)——且实测动态工具不破坏 prompt 缓存稳定性。对 Context Engineering 是工程级实证——与 #92 AgentWeave(推理前确定性路由)同一战场的两档实现:AgentWeave 用信号路由,这篇用按需激活+TTL;工具目录治理从"省 token"升级为"护注意力"——vibe coding agent 的工具注册表应默认待机制。
- 来源: m-reschreiter.at
- 信号: HN 12p · 实测 Codex 14.5k/79 工具 · 基线 4 工具+按需激活+TTL · 缓存稳定性保持
- 关键词: Context Engineering · coding-agent-harness · Coding Agent 成本优化
6. The Reasoning Tax — Token Economy Score:任务结构比名义难度更能预测 thinking 的边际收益(arXiv:2608.26235)
只看准确率的 benchmark 回答不了部署问题:extended thinking 的 token 何时赚回成本?论文提出 Token Economy Score(TES):推理模型相对非推理基线的准确率增益,按生成 token 倍数归一;为带推理开关的模型家族定义 paired TES、为无直接对照的前沿模型定义 approximated TES。151 个模型-基准评测 × 7 个基准(数学/代码生成/科学推理/指令遵循/专家知识/知识回忆/研究级物理):任务结构比名义难度更好地预测推理效率——顺序推理链任务(AIME 2025、LiveCodeBench)TES 高,知识回忆任务(MMLU-Pro)尽管难 TES 却低;更高 reasoning effort 档位呈系统性收益递减,部分案例追加 thinking 反而降准确率;Reasoning Cost Share 显示推理开销常被内部思考主导,Deployment Cost Multiplier 显示本地部署可改变看似昂贵的推理负载的经济学。对 Coding Agent 成本优化 是计量级框架——与 #93 Token 花费可预测(cheap probe 定价)、ProgRouter(步级路由)拼成完整决策链:何时开 thinking(TES)→ 任务定价(probe)→ 档位切换(ProgRouter);对 vibe coding agent 的直接规则:编码/调试链路开 thinking,检索/知识问答关。
- 来源: arXiv:2608.26235
- 信号: arXiv · cs.AI/cs.PF · TES 新指标 · 151 评测 × 7 基准 · 任务结构>难度 · 收益递减实证
- 关键词: Coding Agent 成本优化 · agent-evaluation · Context Engineering
7. Don't Overthink, Don't Underthink — agentic AI 的推理错配:过度推理付费无增益、不足推理直接失败(arXiv:2608.26442)
推理时计算能提升复杂任务表现,但现有方法依赖固定或预分配的推理控制(固定 token 预算、执行前难度估计、激活空间干预),且多在独立推理基准上评测——这些假设在 agentic 系统里不成立:规划、工具使用、记忆检索、agent 间交互中,推理需求是动态演化的。论文把 over-reasoning 与 under-reasoning 刻画为"推理错配"的两类复发失效模式,在 MATH-500 与 GAIA 公开验证集上评测:over-reasoning 案例关联更高计算成本但无成比例的准确率增益;under-reasoning 案例一致地关联错误或不完整解。主张下一代 agentic AI 的核心问题不是"推理多少"而是"按演化中的任务需求分配推理"。对 Coding Agent 成本优化 是失效分类级贡献——与 TES 互补成对:TES 给"开不开"的经济账,这篇给"何时多、何时少"的失效画像;over/under-reasoning 可直接作为运行时监控的两个哨兵指标(配合 #93 Factory 的 pattern-break 检测)。
- 来源: arXiv:2608.26442
- 信号: arXiv · cs.AI/cs.CL · MATH-500+GAIA · over/under-reasoning 失效分类 · 动态推理分配主张
- 关键词: Coding Agent 成本优化 · Coding Agent Failure Patterns · agent-evaluation
8. MemToC — 工具盲从实证:错误工具返回面前,已验证正确答案的存活率仅 6.5-17.1%(arXiv:2608.26295)
工具增强 LLM 在"工具返回与参数记忆冲突"时必须仲裁两个都会错的信源,但既有评测只测信源偏好、不建立信源对错。MemToC:受控的 post-tool-return 仲裁 benchmark——6,504 个评测 episode(542 个质控事实问题、独立诱导的模型专属闭书答案、已知对错的控制工具返回),实例化四类信源对错组合,工具报错与无工具为独立对照。四个指令微调 7-9B 模型上:工具返回强烈支配闭书答案——面对错误工具,保留已验证正确答案的比例仅 6.5-17.1%;跟随正确工具 86.0-93.1%;两源皆错时 78.4-86.0% 的案例照抄工具返回;仅改指令措辞(问题与 episode 内容不变)跨模型排序就不再稳定。SFT/DPO(ToolHop 上链级交叉拟合+不对称成功准则)仅在 2/4 骨干上达标,且20 个方法-模型组合中 19 个在工具报错后减少了弃权。对 agent-evaluation 是仲裁级实证——与 #93 ToolRobustBench(输出扰动是主导瓶颈)互证且更狠:不是"扛不住坏工具",是"坏工具一句话就能覆盖对的记忆";MCP server 的错误返回是现实攻击面——工具结果应带置信度/来源标记,harness 层给"与记忆冲突"的返回加仲裁提示。
- 来源: arXiv:2608.26295
- 信号: arXiv · cs.CL/cs.AI/cs.MA · 6,504 episode · 存活率 6.5-17.1% · 措辞翻转排序 · 19/20 组合减少弃权
- 关键词: agent-evaluation · Context Engineering · mcp-security
9. WikiSkill — skill 进化的持久知识底座:wiki 共演化,他模型演化的技能可胜自演化(arXiv:2608.27454)
自动从 agent 经验中发现 skill 使 agent 能通过交互渐进适应,但指导 skill 开发的洞见通常散落在各次优化历史里,难以跨迭代系统复用。WikiSkill:让 agent skill 与持久知识库(wiki)共同演化——分离原始执行经验、累积知识与可执行技能三层,持续把经验 consolidate 进 wiki,后续 skill 更新在 wiki 上构建。多基准多模型上稳定超过 SOTA skill-evolution 方法、多数设置超过无 skill 基线;三条结构性发现:skill 进化与模型缩放互补——更大的模型通常从演化技能获益更多,带技能的小模型能胜过不带技能的大模型;演化技能跨模型与模型家族有效迁移,且他模型演化的技能可以胜过自演化;消融确认wiki 的持久知识积累是 skill 进化生效的关键。对 Claude Code Skills 是机制级贡献——给 #91 Skill Misevolution(蒸馏不安全成功)与 #93 EVOMAL(skill 库成蠕虫底物)补上建设性一面:技能进化的安全与质量都取决于"经验→知识→技能"的中间层是否持久可审计——wiki 即可审计底座;"他模型演化可胜自演化"直接支持 skill 市场的跨模型流通假设。
- 来源: arXiv:2608.27454
- 信号: arXiv · cs.AI/cs.CL · 超 SOTA skill 进化 · 小模型+技能>大模型 · 跨模型迁移 · wiki 消融关键
- 关键词: Claude Code Skills · Agent Memory · agent-evaluation
10. ASIL — 用结构化状态与语义动作取代截图点击:>80 分且每任务 <5 动作(arXiv:2608.26991)
code agent 能执行脚本/调用工具/管理文件,但大量重要应用仍主要靠 GUI 访问。论文主张 screenshot-and-click 对软件操作型 agent 是低效接口:截图状态不完整、GUI 动作脆弱、语义弱、与长程规划错配。ASIL(Agent-Software Interaction Layer):agent 原生接口——结构化 JSON 观察 + 代码可执行的语义动作,按每个应用的 deepest feasible 访问路径实现。15 个应用 + 300 单应用/80 跨应用任务:闭源模型 >80 分且每任务 <5 动作;同任务截图点击控制组(修复运行时+50 步预算)严格成功率仅 6.6/26.6(较易的 OSWorld 可比带升至 15.0/53.3);对匹配任务的应用原生接口,超 LibreOffice UNO API 28-38 个严格分,但只追平 draw.io 的 MCP 内容契约。结构化模态也利训练:SFT 把 Qwen3.5-2B 从 58.0 提到 72.1、9B 从 66.6 提到 80.4,资源受限的 on-policy RL 进一步到 74.4/82.2。对 coding-agent-harness 是接口层级贡献——" deepest feasible access path"是可抄的原则:浏览器自动化是兜底不是首选,先找 API/IPC/协议层;与 #93 oh-my-pi(IDE 语义供给)同向——结构化通道对推理与训练双重友好。
- 来源: arXiv:2608.26991
- 信号: arXiv · cs.AI · 15 应用/380 任务 · >80 分/<5 动作 · 超 UNO 28-38 分 · SFT+RL 提升 16-24 分
- 关键词: coding-agent-harness · agent-evaluation · Context Engineering
11. PLCBench — 首个真 PLC 硬件在环评测:31.3% 的 episode 实现持续物理影响(arXiv:2608.26882)
工业控制系统(ICS)靠 PLC 连接网络计算与物理控制;工具使用型 LLM agent 是新兴攻击威胁——能否把网络可达的 PLC 转化为持续物理损害?既有评测停在数字任务或 PLC 测试的单个阶段,而在 ICS 里停在软件利用/一次写入/工具访问会误判物理风险。PLCBENCH:首个真 PLC hardware-in-the-loop 框架——供应商原生交互 + 商用 PLC 执行 + 闭环降阶过程仿真 + 独立结果验证;确定性评估器给 runner/通信/PLC 对象/过程记录打六个隐藏诊断旗标,区分"可用交互/过程关联操纵/持续物理影响"。4 台商用 PLC × 4 闭环负载 × 5 个 LLM 家族 × 240 个真 PLC episode:75 个(31.3%)维持其物理目标;分阶段看 98 个止步于有效原生读取之前、62 个到达过程关联写入但未维持目标;过程观测越丰富,过程关联写入后的条件达成率从 44.2% 升到 64.0%。对 agent-evaluation 是物理世界级新阵地——agent 安全评测从数字域跨入物理域:"给 agent 更多可见性=更强攻击力"的量化关系对工具设计是双刃剑提示;与 URML 物理安全评测(见需要深入)构成同一新战线。
- 来源: arXiv:2608.26882
- 信号: arXiv · cs.CR/cs.AI · 首个真 PLC HIL · 240 episode · 31.3% 持续物理影响 · 观测丰富度 44.2%→64.0%
- 关键词: agent-evaluation · Agent Safety · mcp-security
12. BekchiAI — 测量+观测+控制一体:2,057 个确定性任务,故意配不完美的签名扫描器(arXiv:2608.26867)
准确率榜单测不出 agentic 技能——正确排序工具调用、依赖下规划、判断不可信输入、grounding 生成参数。BekchiAI 双面一体:BekchiAI-Benchmark(13 个工具使用 ReAct agent × 7 类任务——算术/结构化 SQL/安全检测/URL grounding/规划/编排/工具策略——共 2,057 个确定性可验证任务,金答案由真数据库跑规范 SQL、精确计算 DAG 调度、求值闭式 lambda 得到;对抗安全样本特意配上故意不完美的签名扫描器,分数反映模型自身判断而非抄 oracle)+ BekchiAI-Platform(部署 agent 的 Web 观测与控制层:全量 token/延迟遥测 + 远程终止)。行为指标超越准确率:工具调用遵循度、URL 幻觉与来源匹配、每模型 token 成本;四模型对比(Qwen3.7-Max、gemma-4-31B-it、gemma4:26b、gpt-oss-120b)的故事在家族内分布而非聚合分。对 agent-evaluation 是协议级贡献——"故意不完美的参考实现"是对抗 benchmark 造假的优雅解法:模型抄不到标准答案,只能真判断;评测+遥测+远程终止三合一的形态正是自建 agent 需要的质量基建最小集。
- 来源: arXiv:2608.26867
- 信号: arXiv · cs.AI · 2,057 确定性任务 · 故意不完美扫描器 · 行为指标 · 遥测+远程终止
- 关键词: agent-evaluation · Coding Agent Verification · coding-agent-harness
观察清单
| 主题 | 信号强度 | 备注 |
|---|---|---|
| 滥权与治理 | ★★★★★ | 提权 13/13×6 harness(自动审查也失守);用户策略反更弱(−20.1pp);运行时五原语 |
| harness 方差与上下文税 | ★★★★ | 机械压缩旧工具结果 F2PF 28→49%;turn-zero 14.5k/79 工具;动态激活+TTL |
| 推理经济学 | ★★★★ | TES:任务结构>难度;over/under-reasoning 失效分类;档位收益递减 |
| 工具盲从 | ★★★★ | MemToC:错误工具前正确答案存活 6.5-17.1%;19/20 训练组合减少弃权 |
| skill 进化知识底座 | ★★★ | WikiSkill:wiki 持久化是关键;跨模型迁移;小模型+技能>大模型 |
| 物理域安全评测 | ★★★ | PLCBench 31.3% 持续物理影响;ASIL 结构化接口超 UNO 28-38 分 |
| 落选备查 | ★★ | experiential(HN 207p,星弱已记 #92);KHMS 自装记忆(HN 10p,早期);DHH 视频(观点);free-claude-code(ToS 灰色);orca/oh-my-openagent/Cybersecurity-Skills(已覆盖) |