Agent Learning Daily Digest #92 — 2026-08-27
周四(264 条采集,arXiv 4 查询全部成功;r/LocalLLaMA 与 r/MachineLearning 429;跨天去重跳过 ~20 条 #88-91 已覆盖项:Compaction Cliff、IBIA、BASM、Signal or Noise/WebDev-Skills-Bench、SWE Refactor Bench、Prime Agent、Weighted Memory Tree、ClawProBench、vLLM-iOS、omnigent、context-engineering-kit、Tobi 禁用推文、agent.md、Henka、claude-plugins-community、Apache Maka、cursor/plugins、munder-difflin、OpenViking、ai-memory、AI-Infra-Guard、deepagents、SDI hash 账本等)。今日连续第二天为论文密集日(9/12 来自 arXiv),两条主线:harness 层的"软标准化"——单作者源码级案例研究证明三个对立哲学的 harness(deepagents/pi/dsh)收敛到同一组五个要素,同日 HarnessRouter 用 2.5 周 614★ 的速度把"统一 Harness 协议(UHP)"做成开源标准,Warren 把 agent 运行做成基础设施;上下文经济学——SparseRead 准入控制省 92.9% token、Paritok-4B 抽取式压缩到 25.7%、AgentWeave 推理前路由砍 61.7% 输入 token、Handoff Tax 量化"升级只追回不到一半差距"。另:Station 环境产出真实新颖数学结果(5 个问题)、TraceGrant 在 1,349 个攻击用例上零失守。
今日高信号
1. The Empire, Long Divided, Must Unite — 三个对立哲学的 harness 源码级趋同:五个收敛要素与一个不收敛缺口(arXiv:2608.23953)
单作者(Jiahong Dai)源码级多案例研究,选了三个刻意对立哲学的开源 coding-agent harness:LangChain deepagents(全家桶)、Earendil pi(极简主义)、DeepSeek dsh(一切皆插件)。核心主张:约束 agent 行为的越来越是 harness 层而非模型层。发现:三者收敛到五个反复出现的要素——商品化的循环(commoditised loop)、append-only 可重放会话记录、模型怪癖作为数据保存、上下文的渐进式披露、显式扩展缝(extension seams);deepagents 与 pi 朝相反方向旅行(一个做减法、一个做加法)却在中间相遇;dsh 作为事后 held-out 检验五个要素全部命中、甚至有一个缝直接复用了另一家的实现。唯一不收敛的维度:外部可验证性(不信任 runtime 也能验证的 tamper-evident 记录)——作者读作预测性缺口。对 coding-agent-harness 是架构级贡献——与 #91 Prime Agent(30%→95.5%)、#90 microcc("harness 选择解释大部分方差")合流:harness 差距叙事从厂商 benchmark 进入源码比较学;自建 harness 时五个收敛要素就是 checklist,而"外部可验证性"是留给下一个人的空位——与 #90 Salt method 的 kernel-checked artifact 恰好互补。
- 来源: arXiv:2608.23953
- 信号: arXiv · 单作者 · 三 harness 源码级对比 · 五收敛要素 · dsh 作 held-out 验证
- 关键词: coding-agent-harness · Coding Agent Verification · agent-evaluation
2. TraceGrant — 契约治理的任务-效果生命周期:1,349 个攻击用例零失守、效用保持 77-83%(arXiv:2608.21126)
联网 LLM agent 从邮件、云存储、日历、交易平台取内容完成多步任务并产生持久外部效果——合法执行所需的内容同样可能携带间接 prompt 注入。TraceGrant(Liao 等,经子代理确认与 #90 的 AID-Guard/arXiv:2608.21159 是不同作者群的不同论文):以显式 Contract 治理任务-效果生命周期——执行前从可信用户请求确立任务-效果边界;执行中,被采信的证据只能实例化 Contract 已建立的授权(不能新增);执行后按实际工具结果验证任务完成。评测:AgentDojo 949 + Agent Security Bench 400 共 1,349 个攻击用例零攻击成功,受攻击下效用分别保持 77.32%/83.00%;另有白盒防御感知攻击、阶段消融、压力测试与运行时开销测量。对 Agent Safety 是协议级贡献——与 AID-Guard(授权到效果闭环)拼成同一周的双联画:一个管"授权的弧",一个管"内容的权";"证据只能实例化既有授权"这一条是间接注入的釜底抽薪——比过滤不可信内容更结构化。
- 来源: arXiv:2608.21126
- 信号: arXiv · 1,349 攻击用例零成功 · 效用 77-83% · 白盒攻击消融齐备
- 关键词: Agent Safety · mcp-security · coding-agent-harness
3. Paritok-4B — 抽取式意图条件压缩器:压到 25.7% 保留 86.5% 解题力,gpt-5 当压缩器是净负的(arXiv:2608.24188)
coding agent 每轮把大文件读取与工具输出重发给前沿模型,上下文主导 token 账单;通用 prompt 压缩器在散文上训练、不适合代码——会意译标识符、丢掉 agent 恰恰要编辑的精确 span。Paritok-4B(Shi & Chen):4B LoRA 抽取式压缩器(Qwen3-4B 微调,gpt-4.1-mini 教师蒸馏 67,074 条 OpenHands 轨迹 → 40,606 条验证样本),两个承诺:抽取式(选择 span 而非改写——96.0% 输出标识符/路径/数字逐字来自输入,held-out 96.2%)与意图条件(按当前任务决定哪些行存活)。结果:压到 25.7% 大小(同压缩率下 gpt-4.1-mini 只能到 50.2%、gpt-5 到 61.9%),保留 86.5% 未压缩解题质量;264MB 适配器单卡 24GB 自托管;按牌价让 gpt-5 当压缩器是净负收益。对 Coding Agent 成本优化 是工程级贡献——"抽取而非改写"对代码上下文是正确约束:意译是 bug 源;意图条件化与 #91 Architecture Equalizer(弱模型吃结构化格式)同向——压缩器的价值在保真边界内谈成本。
- 来源: arXiv:2608.24188
- 信号: arXiv · 25.7% 压缩 / 86.5% 质量保留 · 96% span 保真 · Apache-2.0 · 单卡可跑
- 关键词: Coding Agent 成本优化 · Context Engineering · coding-agent-harness
4. SparseRead — 准入控制式稀疏阅读:最高省 92.9% token、89.0% 墙钟时间(arXiv:2608.22237)
长程 agent 反复读外部工件,但现有读取接口暴露整个对象即使只需稀疏证据——过度读取推高 token 与延迟、稀释任务相关证据;现有上下文缩减方法多在内容已进入轨迹之后干预。SparseRead:training-free、模型透明的读取层做准入控制——regime 感知的 Read Gate + 可扩展 Reader Backends + 有状态协议(有界、锚定来源的证据获取,含精化/验证/停止/回退)。跨 6 个前沿模型(含 Claude Opus 5)× 5 类工作负载:最高 92.9% token 缩减、89.0% 墙钟时间缩减,任务质量保持或提升;收益跨 3 个 agent 框架成立。对 Context Engineering 是层级定位级贡献——"在内容进入上下文之前控制准入"与"进入之后压缩"是两个不同战场:准入控制无需训练、无质量税——文件读取工具应内置 gate 而非事后 compact;与 #91 Compaction Cliff(压缩失真)互补:最好的压缩是不进来。
- 来源: arXiv:2608.22237
- 信号: arXiv · 92.9% token / 89.0% 时间缩减 · training-free · 6 模型 × 5 负载 × 3 框架
- 关键词: Context Engineering · Coding Agent 成本优化 · coding-agent-harness
5. AgentWeave — 推理前确定性路由:工具呈现 −70%、输入 token −62%、延迟 −51%(arXiv:2608.23078)
LLM 面对越来越大的工具/函数/API 集合:候选动作空间越大,函数调用模型要处理越多 schema、吃越多 prompt token、在更相似的无关节奏间分辨。AgentWeave:确定性 pre-inference 路由——用资格、需求、能力与路由信号在 LM 推理之前构建有界的模型可见动作空间,下游模型不动。结果(48 个 BFCL V4 多函数任务,冻结 MadeAgents/Hammer2.1-1.5b):6/48 vs 全量/随机 top-8/语义 top-8 的 0/48(+12.5pp,McNemar p=0.031);工具呈现 −70.18%、输入 token −61.70%、延迟 −50.95%。⚠️ 论文自注"deliberately narrow":这是 BFCL 衍生的路由压力研究而非官方榜单,绝对成功率仍低。对 Context Engineering 是动作空间治理级贡献——工具目录本身就是上下文:"routing before reasoning" 与 SparseRead(读取准入)、Paritok(轨迹压缩)合成今天的三层上下文经济学:进上下文前路由、进上下文时抽取、进上下文后压缩——每层各有最优解。
- 来源: arXiv:2608.23078
- 信号: arXiv · +12.5pp(6/48 vs 0/48)· token −61.7% · 延迟 −51% · 论文自注 deliberately narrow
- 关键词: Context Engineering · coding-agent-harness · agent-evaluation
6. Prompt 工程技术的"老化"是模型家族特异的——结构化技术 aged fastest(arXiv:2608.24641)
PET(prompt engineering techniques)已是 AI 系统软件工程的一部分,但新模型频发,技术有效性如何跨代际变化并不清楚。ICSME 2026 接收的部分复现研究(Rudyk/Oertel/Hebig,复现 Khojah et al. 2025):五种技术(Zero-Shot、Few-Shot、CoT、Contrastive CoT、改编 Program-of-Thought)× 三个版本对(GPT-3.5-Turbo→GPT-4o、Qwen2 7B→Qwen2.5 7B、Mistral-7B→Mistral-Large)× 清洗后 CodePromptEval 子集(218 个 Python 函数、19,620 次生成、pass@k)。核心发现:老化是家族特异的——GPT 家族上结构化 prompting 边际收益递减甚至转负(脚手架已被内化,结构化技术老化最快);Qwen 仍从 Few-Shot 与 CCoT 显著获益;Mistral 混合(CCoT 持续有效、CoT/PoT 衰减)。对 Context Engineering 是维护性实证——prompt 技巧是会过期的资产且保质期因模型家族而异:跨模型迁移 prompt 库需按家族重测;"旧模型的 CoT 模板拖累新模型"是 prompt 负债——与 #90 Sanglard agent.md 的"每条规则要有出处"呼应:出处里应包括"在哪个模型版本上验证过"。
- 来源: arXiv:2608.24641
- 信号: arXiv · ICSME 2026 · 3 版本对 × 19,620 生成 · 家族特异性老化
- 关键词: Context Engineering · agent-evaluation · Claude Code Skills
7. The Handoff Tax — 跨模型续跑的切换税:升级只追回不到一半差距,降档反而划算(arXiv:2608.24358)
coding agent 长任务跨几十次模型调用,用户面临成本-质量权衡:卡住时升级强模型、难点过去后降档省钱——每次切换都要求接收方续写另一个模型产出的"非原生轨迹"。论文系统研究这个 handoff(Ganz/Nacson/Kalyanpur/Litman):Claude 与 GPT 家族的 LC-HC 配对,变化切换方向、时机与接口(全量转移 / 压缩 / 删除轨迹但保留 repo 状态)。核心发现:全轨迹升级只追回不到一半的 LC→HC 质量差距、却要付可观的成本溢价(税);降档是有利的成本-质量点;接口偏好随方向反转——删掉弱模型轨迹反而提升升级效果,删掉强模型轨迹则伤降档。对 Coding Agent 成本优化 是决策级量化——"升级救场"的直觉高估了收益:非原生轨迹是拖累,升级时轻装(丢轨迹保 repo 状态)更好;降档是免费的午餐——这直接给多档位模型路由(vibe coding agent 的 escalate/de-escalate 策略)提供了接口设计规则:方向不同、策略相反。
- 来源: arXiv:2608.24358
- 信号: arXiv · 4 作者 · 升级追回 <50% 差距 · 接口偏好随方向反转 · Claude+GPT 双家族
- 关键词: Coding Agent 成本优化 · coding-agent-harness · agent-evaluation
8. Station — 开放世界多 agent 环境的自主数学发现:5 个问题产出真实新颖结果(arXiv:2608.23691)
Station(Chung/Du/Wesley):开放世界多 agent 环境——不同模型家族的 agent 追逐共享研究目标,无中央协调器、无脚本化流水线;agent 自选研究方向、做实验、协作、共建共享文献库。在 AlphaEvolve 目录 12 个构造问题 + 2 个案例研究上:5 个问题产出相对已知文献新颖的结果——有限域 Kakeya 集的新无限族、11 维新的精确 604 点 kissing 构型、离散 Kakeya needle 与 sign uncertainty 问题新纪录、Erdős minimum-overlap 问题下界的实质改进、Book Ramsey 数的新无限族;agent 还产出解释构造的定理与分析;全部对话、证明、验证代码开源。对 Multi-Agent Communication Patterns 是涌现级实证——"无编排者的协作"产出了真数学:共享文献库(而非消息总线)是多 agent 科学的协调介质——与 #90 AI-to-AI Reviews(AI 审 AI)合看,agent 间知识制品流转比 agent 间对话更是协作本体;也接 AlphaEvolve 谱系但去掉了进化编排器。
- 来源: arXiv:2608.23691
- 信号: arXiv · 3 作者 · 5/12 问题新颖结果 · 无中央协调 · 全产物开源
- 关键词: Multi-Agent Communication Patterns · agent-evaluation · coding-agent-harness
9. AgentRoom — CRDT 共享工作区的并发多 agent 编码:协调协议承担主要负载(arXiv:2608.23740)
并发多 agent 编码许诺按模块分工、冗余容错与多文件级并行,但 LLM 逐 token 生成使现有系统要么 phase 交接串行、要么汇总池化。AgentRoom(Cho & Lee):把人类实时协作编辑的 CRDT 引入 agent——文件级 claim(认领)、status(状态)、broadcast(广播)作为 MCP 工具暴露在 CRDT 合并的共享文件系统上。5 个前沿 coding-CLI 模型 × 4 个后端任务(Python DevBench + Rust/axum):CLI 稳定的模型上,2-agent AgentRoom 比 Solo 弃题更少、run-to-run 方差更小;等算力下对 parallel-merge 有一个正向 LLM-judge 均值差;关键归因:承担负载的是协调协议(claim/status/broadcast)而非并行性或 CRDT 合并本身。对 Multi-Agent Communication Patterns 是机制拆解级贡献——"CRDT 解决 agent 协作"是诱人但错误的归因:可认领的工作面 + 状态广播才是;证据是 ordering 级而非百分比级,结论克制——与 #91 KiroCrew(工作区为资产单位)同向:共享工作区 > 消息编排。
- 来源: arXiv:2608.23740
- 信号: arXiv · 2 作者 · 5 模型 × 4 任务 · 弃题更少/方差更小 · 归因到协调协议
- 关键词: Multi-Agent Communication Patterns · Coding Agent 编排模式 · coding-agent-harness
10. ctx — agent 会话史的本地全文检索:"git blame for agent sessions",索引 17 个 harness(1,044★)
ctxrs/ctx(1,044★、Apache-2.0、Rust、2026-02-23 创建,验证时仍在分钟级提交):本地搜索你机器上已有的 coding-agent 会话记录——索引 ~/.claude、~/.codex 等 JSONL/SQLite 转录源到 Tantivy;无 hook、无云、无 API key。覆盖 17 个 harness(Claude Code、Codex、Grok Build、DeepSeek Harness、Cursor、Pi、Copilot CLI、OpenCode、Gemini CLI/Antigravity、Factory Droid、OpenClaw、Hermes Agent、AstrBot、NanoClaw、Shelley、Auggie、Cline/Roo);宣称比原始转录搜索省 50× token,Tantivy 索引比前代 SQLite 管线快 16×(9.65s vs 155.09s)。注意:"git blame for agent sessions"的归因功能属付费 ctx pro($20/月),开源核心是检索。对 Agent Memory 是立场鲜明级条目——repo 明确把自己定位在"有损 agent memory"的对立面:会话转录已是事实上的记忆,缺的是召回接口——"精确重放过去"与"总结成记忆"是两条路线;17 家 harness 通吃说明转录格式趋同已在发生(与 #1 的五收敛要素互证)。
- 来源: GitHub ctxrs/ctx
- 信号: 1,044★ · Apache-2.0 · 17 harness 索引 · 本地/Tantivy · 分钟级活跃提交
- 关键词: Agent Memory · coding-agent-harness · Context Engineering
11. HarnessRouter + UHP — 统一 Harness 协议:开源标准 + 参考实现,2.5 周 614★(GitHub)
HarnessRouter/harnessrouter(614★、Apache-2.0、2026-08-09 创建——仅 2.5 周):自托管 Docker 容器把多个 agent harness 跑在一个 OpenAI Responses 兼容 API 后面——会话、流式、取消、幂等、BYOK、无遥测;默认后端 claude,codex,hermes,pi,dsh,opencode 六家。更大的一笔是 Unified Harness Protocol(UHP):独立开源标准(unifiedharnessprotocol.org,版本 2026-08-11,十章规范性内容 + OpenAPI 3.1 + 一致性测试套件),本仓库是其参考实现与社区版(托管版 harnessrouter.ai)。对 coding-agent-harness 是标准化竞速级信号——继 #90 omnigent(9.2k★ meta-harness)与 AWS CAO(编排现有 CLI)之后,第三条路线出现:不编排、不套壳,而是定义 harness 的公共 API 协议——2.5 周 614★说明需求真实;"OpenAI Responses 兼容"是聪明的楔子:上层应用零改动接入;vibe coding agent 应盯 UHP 规范——若成型,harness 间迁移成本趋零。
- 来源: GitHub HarnessRouter/harnessrouter · unifiedharnessprotocol.org
- 信号: 614★(2.5 周)· Apache-2.0 · UHP 开源标准 + OpenAPI 3.1 + 一致性套件 · 6 后端
- 关键词: coding-agent-harness · Coding Agent 编排模式 · Claude Code Skills
12. Warren — 把 coding agent 当基础设施跑:隔离、生命周期、限额、Git 交付(338★)
jayminwest/warren(338★、MIT、TypeScript/Bun、2026-05-08 创建,验证时仍在推送,托管版 app.warren.run):"像运行基础设施一样运行 coding agent,而非终端会话"——每次运行在独立 worktree/clone 与自己的分支上(fresh state);隔离三档(bwrap / sibling Docker / K8s pod);dispatch-monitor-cancel-finalize 生命周期 + 实时事件 + steering + spend caps(花费上限) + watchdog 恢复;最后经 Git 交付(凭证、分支、push、PR)。现成 harness 适配器:Pi 与 Claude Code;运行时本地/docker/kubernetes。对 coding-agent-harness 是运维层成型级信号——warren 命名的对立面正是现状:终端会话不是工作负载单元。"fresh worktree + spend cap + watchdog + Git 交付"把 #91 KiroCrew(产品化无人值守)与 #90 Munder Difflin(订阅复用)的诉求拉成可自托管的最小集——vibe coding agent 的执行层照此清单对照缺口。
- 来源: GitHub jayminwest/warren
- 信号: 338★ · MIT · Pi + Claude Code 适配 · 三档隔离 · spend caps + watchdog
- 关键词: coding-agent-harness · Coding Agent 编排模式 · Agent Safety
观察清单
| 主题 | 信号强度 | 备注 |
|---|---|---|
| harness 软标准化 | ★★★★★ | 五收敛要素(源码级证据); UHP 协议 2.5 周 614★; 17 家转录格式被 ctx 通吃 |
| 上下文经济学三层 | ★★★★★ | SparseRead 92.9% (准入) + Paritok 25.7% (抽取) + AgentWeave −61.7% (路由) |
| 模型切换税 | ★★★★ | 升级追回 <50% 差距; 降档划算; 接口偏好随方向反转 |
| 注入防御结构化 | ★★★★ | TraceGrant 1,349 用例零失守; 与 AID-Guard 双联画 |
| 无编排者协作 | ★★★ | Station 5 个真新颖数学结果; AgentRoom 归因到协调协议 |
| Prompt 技术老化 | ★★★ | 家族特异性; GPT 结构化收益转负; Qwen 仍吃 Few-Shot |
| Agent 运维层 | ★★★ | Warren 隔离+限额+watchdog; agents-as-infra 自托管最小集 |
| 落选备查 | ★★ | OpenDesign 91.8k★(4 个月,营销重); hermes-agent 236.9k★ 核验为真; Alex Kras "I miss the old Claude Code"(36p); ReproAgent; MARS; deepagents 28.6k★ 常驻 |