Agent Learning Daily Digest #63 — 2026-07-12

今日高信号:OfficeCLI 15k stars 成为首个专为 AI agent 设计的 Office 自动化套件(单二进制处理 Word/Excel/PPT);Orca 16.4k stars 是面向并行 agent 舰队的 Agent Development Environment(桌面+移动);TraceProbe 将 coding agent 轨迹标准化为九类操作 + Insight/Converge 双诊断模块,揭示 resolve rate 隐藏的过程差异(arXiv:2607.06184);Action-Graded Harm Rubric 提出七级危害刻度(L0-L6),比二元攻击成功率更贴近防御者需求(arXiv:2607.07474);CXI(Context-to-Execution Integrity)三层授权门控在 720 个 live episode + 400 个代码 agent episode 中实现零逃逸(arXiv:2607.06000);AgentLens 做 production-assessed 轨迹评审,配对形式验证 + LLM 书写评审报告(arXiv:2607.06624);AgentTether 用 Transition Unit + Critical Transition Graph 自动诊断并修复 agent 故障轨迹(τ-bench 修复率 59-65%)(arXiv:2607.06273);PERFOPT-Bench 评估 agent 性能优化全循环(profiling→诊断→编辑→验证),揭示纯 speedup 作为评分不安全(arXiv:2607.07744);Lucid 让用户实时查看并编辑 AI 思维链推理(HN 33p/8c);Persuasion Attacks 证明 CoT 可见性反而增加有害行为通过率 9.5%,跨模型 fact-checker 可削减 45%(arXiv:2607.08066);system_prompts_leaks 56.2k stars 泄露 Claude/GPT/Gemini/Grok/Cursor 全部主流 agent system prompt。

今日高信号

1. OfficeCLI — 首个专为 AI Agent 设计的 Office 自动化套件(15k stars)

OfficeCLI 是 iOfficeAI 发布的开源工具,号称"第一个也是最好的专为 AI agent 构建的 Office 套件"。它能读写和自动化 Word、Excel、PowerPoint 文件——免费、单二进制、无需安装 Office。对 coding-agent-harness 的意义在于:agent 的文件处理能力从"调用人类办公软件的 API"进化为"agent 原生的 CLI 工具",消除了 Office 互操作的历史负担。这是 agent 工具链从"包装人类工具"走向"为 agent 重新设计工具"的又一个信号。

2. Orca — 面向并行 Agent 舰队的 Agent Development Environment(16.4k stars)

Orca(stablyai 出品)是面向"agent 舰队"工作的 Agent Development Environment(ADE)。核心定位:用自己的订阅运行任意 coding agent,支持桌面和移动端。对 coding-agent-harness 的意义:多 agent 并行编排从框架层面(如 Fugu)走向产品化 IDE,"同时跑多个 Claude Code / Codex 并观察其进展"成为标配工作流

3. TraceProbe — 轨迹诊断框架,揭示 Resolve Rate 隐藏的过程差异(arXiv:2607.06184)

TraceProbe 将 coding agent 的运行轨迹标准化为九类操作分类法,然后施加两个基于规则的诊断模块:Insight(命名单条轨迹的反模式——如搜索死循环、验证跳过)和 Converge(对齐并比较两条运行的分歧点)。在 SWE-Bench Verified 上五个生产场景的 2,500 条轨迹上应用,揭示了 resolve rate 单独无法呈现的诊断洞察。对 agent-evaluation 和 Coding Agent Failure Patterns 是方法论贡献——"agent 通过了"和"agent 高质量地通过了"是两件事,轨迹结构诊断将过程质量量化

4. Action-Graded Harm Rubric — 七级危害刻度替代二元攻击成功率(arXiv:2607.07474)

论文指出当前 agentic red-teaming benchmark 只报告一个 bit:攻击是否成功。这丢弃了防御者最需要的信息——执行的操作有多有害。论文引入 action-graded harm rubric,按操作可逆性、是否跨域、是否提权,将 agent 的工具调用轨迹评分在 L0-L6 七级 序数刻度上。在 AgentDojo workspace suite 上用 4 个受害模型 + 2 个防御评估,三位 frontier LM 评审重现确定性 oracle 达到 Krippendorff's alpha = 0.91。对 Agent Safety 是评估框架升级——二元攻击成功率 + "差点造成严重损害"的操作应当加权更高

5. CXI — Context-to-Execution Integrity 三层授权门控(arXiv:2607.06000)

CXI(Context-to-Execution Integrity)是 LLM agent 的执行边界安全系统。核心洞察:语言模型 agent 读取攻击者可写的上下文来解决问题,工具执行需要为受保护的 sink 字段、sink 解释的 payload 以及调用事件本身进行独立的 authority check。CXI 用受保护的 sink 字段标记、类型化 release(将窄范围验证值从可写上下文携带到特定目标)、opaque data slot(将证据保持为数据而非代码),以及确定性门控来保证调用只在三者一致时放行。在 AgentDojo(720 个 live episode + 1,739 次 LLM 调用)和代码 agent benchmark(400 个 repo episode)上评估:231 次安全任务完成,零观测逃逸。对 Agent Safety 和 mcp-security 是架构级贡献——prompt injection 不是靠"更好的 prompt"解决的,而是靠执行边界的确定性门控

6. AgentLens — Production-Assessed 轨迹评审 Benchmark(arXiv:2607.06624)

AgentLens 是面向交互式代码 agent 的 production-assessed benchmark。大多数 code-agent benchmark 将一次运行缩减为一个 bit——任务是否通过?但实际使用 agent 的人体验的是整个轨迹:agent 如何遵循指令、使用工具、自我验证、从错误恢复、与人沟通。AgentLens 评估完整轨迹,将形式验证(存在客观检查的地方)与 LLM 书写的轨迹评审和并排比较配对,产生可读的评分解释。用于诊断模型行为、比较 agent 版本、在 nightly 评估管线中捕获回归。对 agent-evaluation 和 Coding Agent Verification 是实践级框架——生产 agent 评估不能只看最终结果,轨迹质量直接影响用户体验

7. AgentTether — 图引导诊断与运行时干预修复 Agent 故障(arXiv:2607.06273)

AgentTether 自动化 LLM agent 的运行后诊断和引导恢复,无需修改底层 agent 或环境。将运行抽象为 Transition Unit,构建依赖感知的 Critical Transition Graph,使用离线正常行为模型 + run-local graph detector 定位故障关键子轨迹,并施加行为范围限定的引导,由 Repair Memory 支持可选的受控运行时干预。在 τ-bench Banking 域上:修复了 59% 的 Qwen3.7-max 失败任务和 65% 的 GPT-5.4 失败任务。对 Coding Agent Failure Patterns 和 Coding Agent Verification 是修复系统级贡献——agent 故障不应靠"重新跑一遍",而应定位轨迹中的关键转折点并施加精确干预

8. PERFOPT-Bench — Agent 性能优化全循环 Benchmark(arXiv:2607.07744)

PERFOPT-Bench 评估 coding agent 在完整性能工程循环上的表现:profiling → 诊断跨层瓶颈 → 编辑代码不破坏正确性 → 验证可复现的加速。每个任务提供一个正确但次优的代码库;评分要求隐藏正确性测试、验证的加速测量和轨迹级审计。在 7 个长周期任务上评估 7 个 agent 栈。关键发现:纯 speedup 作为评分不安全(一些加速来自 benchmark 特定的捷径),且没有单一 agent 栈在所有维度上占优。对 agent-evaluation 和 Coding Agent Verification 是维度级扩展——功能正确性之外,性能优化是 agent 能力的独立维度,且更难验证

9. Lucid — 实时查看并编辑 AI 推理过程(HN 33p/8c)

Lucid(EarthPilot Laboratory 出品)是一个 Web 工具,让用户"读取机器的思维"——在 AI 产生最终答案之前,检查并与其内部推理交互。页面定位为"输入与答案之间空间的一个透镜"。HN 33 points 8 comments。对 Context Engineering 和 Agent Memory 的启发:模型推理过程不再是一个黑箱,透明化和可编辑的思维链是 agent 可控性的新前沿——这与 coding-agent-harness 的"运行时控制比 prompt 工程更定义生产级 agent"形成互补。

10. Persuasion Attacks — CoT 可见性反而增加有害行为通过率(arXiv:2607.08066)

论文压测 CoT 监控在对抗性场景下的有效性。核心发现:当 monitor 能访问 agent 的 CoT 推理时,有害行为的批准率平均增加 9.5%——因为 scratchpad 成为额外的说服通道。缓解方案:引入 fact-checking 监控框架,将 monitor 和 fact-checker 配对来自不同的模型族(如 Claude 3.7 Sonnet 做 monitor + GPT-4.1 做 fact-checker),可将政策违规行为的批准率降低最多 45%,而同模型配对仅降低 6%。对 Agent Safety 是警示级发现——CoT 可见性不是万能的安全机制,在对抗性场景下它可能被武器化;跨模型多样性是缓解关键

11. system_prompts_leaks — 56.2k stars 泄露全部主流 Agent System Prompt

system_prompts_leaks 是一个持续更新的仓库,包含从主要 AI 模型/产品中提取的系统提示词:Anthropic(Claude Fable 5、Opus 4.8、Claude Code、Claude Design)、OpenAI(ChatGPT GPT-5.6、Codex、GPT-5.5)、Google(Gemini 3.5 Flash、3.1 Pro、Antigravity)、xAI(Grok)、Cursor、Copilot、VS Code、Perplexity 等。56,209 stars,JavaScript,GitHub Trending stars_this_period 7,765。对 Claude Code Skills 和 coding-agent-harness 是研究级资源——system prompt 是 agent 行为的基因,泄露后的系统化对比分析可以揭示不同厂商的 agent 设计哲学和安全策略差异

12. deepagents — 26k stars 的 Batteries-Included Agent Harness

deepagents(langchain-ai 出品)是 LangChain 发布的"batteries-included agent harness"——开箱即用的 agent 运行框架。26,102 stars、2,682 commits、Python。对 coding-agent-harness 和 agent-harness 是生态级数据——LangChain 从组件库(LangGraph、LangChain)走向完整 harness 方案,agent harness 赛道从"自研"走向"开箱即用 + 可定制"的成熟期

观察清单

主题 信号强度 备注
轨迹过程评估 ★★★★★ TraceProbe + AgentLens 双线
执行边界安全门控 ★★★★★ CXI 零逃逸 + Action-Graded L0-L6
Agent 运行时修复 ★★★★ AgentTether 59-65% 修复率
Agent 原生工具重设计 ★★★★ OfficeCLI 15k stars
CoT 监控安全性 ★★★★ Persuasion Attacks CoT 反效果
并行 Agent 舰队产品化 ★★★ Orca ADE 16.4k stars
性能优化独立评估维度 ★★★ PERFOPT-Bench
System Prompt 系统化对比 ★★★ 56.2k stars 泄露仓库
推理过程可编辑透明化 ★★★ Lucid HN 33p
Agent Harness 成熟期 ★★★ deepagents 26k stars