Agent Learning Daily Digest #71 — 2026-07-26

今日为 arXiv 全量宕机日(4 个查询全部 429),信号密度较低,但 Claude 5 世代发布带来了两条高信号的结构性变更:Anthropic 官方博客确认删除了 Claude Code 系统 prompt 的 80% 以上(编码 eval 无可测损失),宣告\"规则驱动\"时代让位于\"判断力驱动\"时代;社区验证了 /doctor 命令成为 rightsizing skills 和 CLAUDE.md 的新工具。工程侧 Vercel Deepsec 把 coding agent 当安全扫描器跑出 6.3k stars,jcode(Rust harness,11.4k stars)证明性能优化的 harness 能把 RAM 降到 1/14。MCP 侧 code-review-graph(26.4k stars)和 OmniRoute(30k stars)分别在代码图谱和模型路由上成熟化。方法论侧 Screenpipe(YC S26)把屏幕录制变成 agent 记忆源,Harness Training 把 harness 改进类比为 PyTorch 训练。

今日高信号

1. Anthropic 官方:Claude 5 世代的 context engineering 新规则(claude.com)

Anthropic 官方博客发布《The new rules of context engineering for Claude 5 generation models》,确认一个重大变更:删除了 Claude Code 系统 prompt 的 80% 以上(针对 Claude Opus 5 和 Claude Fable 5),在编码评估上无可测损失。核心范式转换:Then: 给 Claude 规则 → Now: 让 Claude 用判断力Then: 给 Claude 示例 → Now: 模型可推断模式。新模型不再需要显式规则约束,推理能力已内化。博客推荐使用 Claude Code 的 /doctor 命令来 rightsize 你的 skills 和 CLAUDE.md 文件。对 Context Engineering 和 Claude Code Skills 是范式级信号——规则驱动的 prompt 工程在 Claude 5 世代需要被精简,过度规则化反而可能降低模型表现

2. Anthropic 砍掉 80% 系统 prompt — 社区确认(r/ClaudeAI)

Reddit 社区讨论确认 Anthropic 为 Claude 5 模型(Opus 5 / Fable 5)砍掉了 Claude Code 系统 prompt 的 80%,并发布了应保留在 CLAUDE.md 和 skills 中的内容指南。与 #1 的官方博客互为印证——这是同一事件的不同信息源(官方博客 = 原始声明;Reddit = 社区验证 + 实践讨论)。注意:Reddit 页面被反机器人挑战拦截,但核心事实声明已被官方博客完全证实。对 Claude Code Skills 是实践级信号——用户需要主动 audit 并精简自己的 CLAUDE.md 和 skills,不能假设旧规则在新模型上仍然有效

3. Deepsec — Vercel 的 Coding-Agent 安全 Harness(vercel-labs/deepsec)

Vercel Labs 发布 Deepsec——一个用 coding agent 驱动的安全扫描 harness,专门用于在大型代码库中查找漏洞。核心设计:agent 在最高 thinking level 运行(可通过 --thinking-level 调节),大规模并行 fan-out 到多个 worker 机器,支持 interrupt 后 resume。工作流:init → install → scan → process → revalidate → export。大型代码库单次扫描成本可达数千美元。总 stars 6.3k(375 forks,83 commits,非常活跃)。对 Agent Safety 和 coding-agent-harness 是工程级信号——coding agent 不只用于写代码,也可以作为安全审计的核心引擎;Vercel 的产品化验证了 agent-as-scanner 的商业可行性

4. jcode — 性能优化的 Rust Coding-Agent Harness(1jehuang/jcode)

jcode 是一个用 Rust 编写的 coding agent harness,定位为\"最智能的 agent harness\",专为多会话工作流、无限可定制性和性能优化设计。关键 benchmark:baseline 内存 27.8 MB(对比 Claude Code 单会话 386.6 MB——约 1/14),启动时间 14ms(对比 Claude Code 3.4s)。总 stars 11.4k(1.3k forks,6010 commits,152 tags,v0.58.0——成熟项目)。对 coding-agent-harness 是工程级贡献——harness 的性能是一个被忽视的维度,Rust 实现可以把内存占用和启动时间降低 1-2 个数量级,这对并行多 agent 场景至关重要

5. code-review-graph — 本地优先的代码智能图谱(tirth8205/code-review-graph)

code-review-graph(CRG) 构建一个持久的、本地优先的代码智能图谱,把代码库映射成结构化的依赖关系网络,让 AI coding 工具只读取相关的上下文。通过 MCP 和 CLI 集成,有 VSCode 扩展,在代码审查和大型仓库工作流上有 benchmarked 的上下文减少效果。支持多语言(包括 PHPUnit 测试注解检测、自定义语言、SVN 支持)。总 stars 26.4k(2.5k forks,733 commits,v2.3.5——成熟且流行)。对 Context Engineering 和 MCP 生态是工具级贡献——代码图谱是 context engineering 的基础设施层,把\"读什么\"从 prompt 工程变成图查询问题

6. OmniRoute — 290+ 提供商的免费 AI 网关(diegosouzapw/OmniRoute)

OmniRoute 是一个 MIT 许可的免费 AI 网关,把 290+ 提供商(90+ 免费)、500+ 模型聚合在一个 endpoint 后面。支持 quota-aware auto-fallback(配额感知自动回退)、RTK+Caveman token 压缩(节省 15-95% tokens)、MCP/A2A 支持,兼容 Claude Code、Codex、Cursor、OpenCode、Cline、Copilot。总 stars 30k(3.9k forks,5714 commits,v3.8.49——非常成熟)。对 Coding Agent 成本优化 和 coding-agent-harness 是基础设施级信号——模型路由 + 多提供商聚合已成为 coding agent 成本优化的标准化方向,per-request 智能路由 + token 压缩是规模化成本控制的核心

7. Screenpipe — 把屏幕录制变成 Agent 记忆源(YC S26 Launch)

Screenpipe(YC S26)发布——一个本地运行的屏幕/音频录制应用,把工作过程转化为 AI agent 的记忆源。核心设计:录制屏幕+音频,索引到 SQLite,通过 AI 友好的 API(端口 3030)+ MCP + skills 暴露给 agent(Claude、ChatGPT、Hermes 等)。使用事件驱动捕获(应用切换、点击、打字停顿),配合 OS accessibility tree + OCR 回退,而非持续视频。隐私特性:本地 PII 脱敏模型(MLX/DirectML)、录制调度、应用过滤。Rust/MLX/Onnx 构建。对 Agent Memory 是基础设施级信号——agent 记忆不限于文本交互日志,人类工作过程的屏幕录制可以作为 agent 的情境记忆源

8. Awsmux — 多账户 AWS CLI,为 Agent 优化(0hardik1/awsmux)

Awsmux 把一个 AWS CLI 命令并行 fan-out 到数百个账户(默认 100 workers),合并结果为单一流,内置 MCP server 供 agent 使用。150-session benchmark(相同 Claude Opus 4.8 agent):比原始 CLI 1.3-2.9x 更便宜、2.3-5.4x 更快、最多 7.4x 更少 output tokens(Holm 校正 p<0.05)。有 identity verification 和破坏性操作的审批边界。Go 实现,MIT 许可,捆绑 100 账户 LocalStack 沙箱。总 stars 6(全新仓库,42 commits)。对 coding-agent-harness 和 Coding Agent 成本优化 是方法级贡献——为 agent 优化的 CLI 工具可以同时提升速度和降低 token 成本,API 设计直接影响 agent 效率

9. Harness Training — 把 Harness 改进类比为 PyTorch 训练(henrypan.com)

博客文章提出把 agent harness 的自我改进类比为PyTorch 训练:harness = model weights,改进 agent = gradient estimator,任务 LLM = frozen backbone,评估 criterion = loss function,optimizer.step() = git fast-forward。作者构建了一个 PyTorch 式的 harness training 框架(github.com/workofart/harness-training),用 Codex CLI / Claude Code CLI 作为改进 agent。关键突破:确定性(确定性 LLM 推理 + 确定性环境),大幅减少实验时间、提取更多信号。在 Terminal Bench 2.0 和 SWE Bench 上展示了训练效果。对 coding-agent-harness 是方法论级贡献——harness 不是一次性配置,而是可以用类似梯度下降的方式持续优化,确定性是实现这一点的关键前提

10. "AI Mania Is Eviscerating Global Decision-Making" — AI 狂热的批判性反思(HN 35p)

John Gruber(Daring Fireball)链接 Nikhil Suresh 的文章,论证 AI mania(AI 狂热)正在摧毁全球决策能力。核心类比:\"计算机深刻改变了世界……但大多数人无法理解计算机到底如何工作\"——以此类推,AI 的采用可能在缺乏对其能力和局限真正理解的情况下推进。对 Agent Safety 和 Coding Agent Failure Patterns 是元层面贡献——agent 技术的采用需要在 hype 与真实能力之间保持清醒,过度依赖未经充分验证的 agent 系统可能侵蚀决策质量

观察清单

主题 信号强度 备注
Claude 5 删除 80% 系统 prompt ★★★★★ 官方确认:规则→判断力范式转换
Coding Agent 作为安全扫描器 ★★★★ Deepsec: Vercel 产品化, 6.3k stars
Harness 性能是独立维度 ★★★★ jcode: Rust harness RAM 1/14
代码图谱作为 context 基础设施 ★★★★ code-review-graph: 26.4k stars
模型路由网关标准化 ★★★ OmniRoute: 290+ 提供商, 30k stars
屏幕录制作为 agent 记忆源 ★★★ Screenpipe: YC S26, 84p
Harness 改进 = PyTorch 训练 ★★★ 确定性是 harness 训练前提
AI 狂热侵蚀决策质量 ★★★ Gruber/Suresh: 批判性反思