Harness‑Bench 论文学习

2026 年 5 月,北京大学与启元科技的研究团队发布了论文 Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows,用于研究并评测不同 Harness 对 Agent 实际执行能力的影响。在论文中,作者提出了 Harness-Bench——一个包含 106 个沙箱化离线任务、用于在统一任务环境下比较不同 Model–Harness 配置的评测基准。论文发现,Agent 表现不仅取决于 LLM,也取决于 Harness 的执行机制。

恰好最近在研究 Agent 评测,于是对这篇论文进行了精度,并做了如下的摘要。

阅读更多...

面向 Coding Agent 的多仓库 Git Worktree

是时候了解一下 Git worktree 了 一文中,我们介绍了如何在 Codex、Claude Code 等 Coding Agent 中利用 Git worktree 实现并行开发。不过,那篇文章聚焦于单仓库场景。当我们尝试将 worktree 应用于采用多仓库架构的 LLM Arena 平台时,又遇到了一系列新问题。

本文记录我们如何为多仓库场景设计面向 Coding Agent 的 worktree 工作流,以及如何处理子模块初始化、需求编号冲突和多 Agent 编排等问题。

阅读更多...

是时候了解一下 git worktree 了

如何利用 Harness “一句话交付产品功能”? 一文中,我们已经讨论过如何在单个 clone 仓库里借助 Harness Engineering 自动完成需求开发。但问题也随之出现:当这个目录正在被 Coding Agent 执行任务、修改代码、运行测试时,我们能做的往往只剩下等待。

如果还想并行开发另一个功能,最直观的办法是重新 clone 一份仓库到新目录。这个方案能用,但并不优雅:重复下载、重复安装依赖、重复同步分支,最后还要在多个副本之间来回合并。我们需要一种更轻、更原生、更适合并行开发的方案。于是,git worktree 重新进入了视野。

阅读更多...

如何评估 Skill?

对 Agent Skills 的认知与思考 这篇文章对 Agent Skills 做了详细介绍。自 Anthropic 发布 Agent Skills 以来,Skills 已经逐渐成为 Agentic 系统构建中的一种共识范式。无论是公开的 Skills Marketplace、OpenClaw 的 ClawHub,还是团队内部沉淀的专用能力库,Skills 的数量都在快速增长。

Skills Marketplace 平台已经托管了 172W+ 的 Agent Skills;而在年初红极一时的 OpenClaw 的 ClawHub 平台也已经托管了 7W+ 的 Agent Skills;在我们内部,也已经积累了成千上百的 Skills。

阅读更多...

用 Harness Engineering 来进行书籍翻译工作

为了强化对某项特定技术的理解与实践,我经常会利用空余时间阅读并翻译该技术领域的相对较前沿的英文书籍,自从 ChatGPT 发布以来,翻译外文书籍越来越方便。即便如此,翻译一本书还是需要非常多的繁杂的规则,例如:交叉引用、公式编号、字体使用规范、图片引用规范、排版规范……这些规范在我翻译书籍的过程中往往占据了大量的时间。

恰好最近在研究 Harness Engineering,突然我想:写代码与翻译在本质上不都是生成吗?Transformer 架构最初不也是为机器翻译而提出的吗?于是我就想把 Harness Engineering 的思想应用到书籍翻译上来,并依此来分析一下 Harness Engineering 的效果。

阅读更多...

Agent Client Protocol(ACP): AI Coding Agents 的新时代

10 年前,也就是 2016 年,为了解决 VS Code 多语言支持重复开发的问题,微软团队基于 TypeScript Server 的通信机制,开始设计通用协议,以解决编辑器与语言服务解耦。[1] 同年的 6 月 27 日,微软在 DevNation 大会上正式宣布开源 LSP,从而解决了“针对同一语言,每个编辑器都要重写一遍智能提示”的噩梦,也标志着现代 IDE 进入了新的时代。[2]

多年以后,同样的情况出现在了 AI Coding Agent 的领域——2025 年 8 月 27 日,Zed Industries 在博客 Bring Your Own Agent to Zed — Featuring Gemini CLI 中正式公开 ACP 协议,并推出 Zed 中整合的 Gemini CLI 作为首个 ACP 的参考实现。[3]

阅读更多...

通过 Chrome DevTools MCP 增强 Agent 的浏览器操控能力

当我们用类似 Claude Code、Codex、Gemini CLI 等 AICoding Agent 写完代码,然后让它自动生成测试计划、自动调起浏览器来测试刚刚生成的代码,并根据反馈结果重新优化代码。在这个循环中,不需要人手动干预,完全依赖 AICoding Agent 自主操控,这不是一件非常美妙的事情吗?

这不就是当下爆火的 Harness Engineering 吗?正如 Harness Engineering: Why the Best AI Engineers in 2026 Stopped Writing Code 中说的那样[1]

A researcher tested the same AI model on the same coding benchmark twice. The first time, it scored 42%. The second time, it scored 78%. Same model. Same test. Same everything.

如上的框架的核心点在于:AICoding Agent 可以有效的操控浏览器。 本文将介绍三种浏览器控制方案:Playwright、Browser-use 以及伴随 Chrome M144 推出的最新利器 Chrome DevTools MCP,并通过多维度的对比,为大模型应用的架构选型提供参考。

阅读更多...

我让 OpenClaw 🦞 管理大模型评测任务

虽然 LLM 的能力现在已经非常强大,但是对于多模态大模型的评测而言,仍然需要进行大量的人工评测工作。所以,我们也会看到,类似 Arena 平台的这种基于人类偏好打分的榜单,依然是我们评估大模型性能的有效参考。

我们参考 LMArena 团队开源的榜单算法 Arena Rank 构建了自己的大模型 Side-by-Side 评测系统,来满足我们对大模型评测的需求。

阅读更多...

我让 OpenClaw 🦞 帮我部署模型

我让 OpenClaw 🦞 为我当 OP 这篇文章中,我介绍了我是如何让 OpenClaw 帮我管理服务器集群的。

过了几天,我就开始想搞一点更复杂的事情。既然 OpenClaw 都可以帮我管理服务器集群了,那为什么不能让它帮我部署模型呢?反正我每次部署模型不也是先登录 GPU 服务器,然后在上面执行各种 CLI 操作(下载模型、配置虚拟环境、下载依赖……)?并且每次遇到部署问题时,我也是截个图直接丢给大模型……

阅读更多...
  • Copyrights © 2020-2026 Wang Wei
  • 本站访问人数: | 本站浏览次数:

请我喝杯咖啡吧~

微信