Daily AI Insight
数据源洞察报告

免责声明

本站内容由 AI 自动聚合、分析与生成,仅供信息参考与学习交流,不构成投资、法律、医疗或其他重大决策建议。请结合原始信源独立判断,作者不对因使用本站内容而产生的任何后果承担责任。

关于本项目

个人开源实验项目,由 @sqliang 构建与维护。

在 GitHub 查看源码

© 2026 Daily AI Insight Engine · Built with AI-assisted pipelines

← 返回 量子位
Analyzed·分析qbitai.com2026-07-19

Article Intelligence

不换模型,效果提升104%!上海AI Lab让Harness也能自进化了

打开原文 ↗

先看结论

上海人工智能实验室提出 Self-Harness,让 AI Agent 的外层运行装置(Harness)能基于自身执行轨迹自动挖掘弱点、提出修改并通过回归测试验证,不换模型即可提升性能。在 Terminal-Bench-2.0 上,Qwen3.5-35B-A3B 总提升 104%,MiniMax M2.5 和 GLM-5 分别提升 28% 和 24%。

核心指标

先判断这篇文章值不值得继续读

评分用于衡量信号强度,判断类指标用于解释方向、热度、后续动作与可信程度。

影响力

衡量事件对技术、产业或生态的外部影响强度。

7.0

该论文提出了一种让 AI Agent 外层装置(Harness)自动进化的闭环方法论,本质上是将当前高度依赖工程师手动调试的提示词工程和工具规则优化,转变为可自动挖掘弱点、生成修改并通过回归测试验证的标准化流程。在 Terminal-Bench-2.0 上不换模型、不改工具环境即实现 104%(Qwen3.5)的提升,数据扎实。LangChain CEO 和前 OpenAI 副总裁 Lilian Weng 的关注表明该工作在 Agent 社区引起了实质共鸣。虽然尚未达到 ChatGPT 发布级别的范式转移,但 Self-Harness 有望系统性降低多模型、多任务场景下的 Agent 部署调试成本,属于改变局部竞争格局的重要方法论突破。

复合价值

综合新颖性、可执行性与长期观察价值。

7.5

Self-Harness 解决了 Agent 规模化部署中的一个根本性瓶颈:Harness(系统提示词、工具规则、验证器等外层装置)的人工调参无法随模型数量和任务复杂度扩展。其核心复利逻辑在于,每次 Agent 执行产生的失败轨迹都会成为 Harness 自我改进的训练信号,形成'更多部署→更多轨迹→更好 Harness→更好性能'的数据飞轮。这种自我进化的能力在 Agent 从实验走向生产的关键阶段具备基础设施级潜力,且 LangChain CEO 的站台和 Lilian Weng 的认可表明社区正在押注这一方向。但当前局限也明显:仅在一个 benchmark(Terminal-Bench-2.0)上验证,跨任务域的泛化性未知;自进化过程需要大量回归测试算力,实际部署成本待评估;不排除未来基础模型能力大幅提升后 Harness 敏感性下降。综合来看,有潜力成为 Agent 中间件层的标准能力,但仍需更多工程落地验证,评分落在'细分赛道基础设施潜力'区间的上沿。

01

提取事实

结构化事实、实体识别与逻辑链

TL;DR

上海人工智能实验室提出 Self-Harness,让 AI Agent 的外层运行装置(Harness)能基于自身执行轨迹自动挖掘弱点、提出修改并通过回归测试验证,不换模型即可提升性能。在 Terminal-Bench-2.0 上,Qwen3.5-35B-A3B 总提升 104%,MiniMax M2.5 和 GLM-5 分别提升 28% 和 24%。

框架工具科技媒体已核实
客观摘要

上海人工智能实验室团队于 2026 年 7 月提出 Self-Harness 方法,让底层模型基于自身执行轨迹自动改进 Agent Harness(系统提示词、工具规则、验证器、运行时控制策略等外层装置)。该方法通过三步闭环运作:先挖掘失败轨迹中的可复用弱点模式,再由同一模型提出限定可编辑表面的修改方案,最后通过 held-in 和 held-out 回归测试决定是否采纳。在 Terminal-Bench-2.0 多轮智能体评测中,不换模型、不改工具环境和评测协议,仅迭代 Harness 即实现三个模型后端的 held-out 提升。该项目已被 LangChain CEO Harrison Chase 转发,并被前 OpenAI 副总裁 Lilian Weng 收录进自进化 Agent 相关博客。

逻辑链
  1. 1上海人工智能实验室提出 Self-Harness 方法,让模型基于自身执行轨迹自动改进外层 Agent Harness,无需替换底层模型。
  2. 2Self-Harness 流程分为三步:Weakness Mining 从失败轨迹中挖掘可复用的失败机制,Harness Proposal 由同一模型提出限定可编辑表面的修改方案,Proposal Validation 通过回归测试决定是否采纳。

情绪

积极

整体偏利好,可优先看它带来的机会、受益方和后续扩散可能。

Hype

低 hype

噪声较低,信息更接近事实或研究贡献;重点看证据是否扎实。

文章虽标题使用了'自进化'等吸引眼球的表述,但论文本身提供了完整的实验设计(held-in/held-out 双回归测试)、消融细节和模型特异的失败模式分析。三个跨模型的一致提升加上 LangChain CEO 和 Lilian Weng 的背书,说明这不是概念炒作而是有实质工程价值的方法论。文章没有使用'颠覆性'、'革命性'等 PR 滥调,而是聚焦在技术细节和实验数据上,水分较少。

行动建议

策略投资

值得进入重点池,后续可沉淀为主题、竞品或投资观察。

置信度

分别对应影响力、复合价值与 Hype 判断的可信程度。

影响判断high· 依据较充分
价值判断medium· 可参考
热度判断high· 依据较充分
  • 3回归测试采用保守接受规则:held-in 或 held-out 至少一个 split 必须提升,另一个 split 不能退化,改动才能进入下一代 Harness。
  • 4在 Terminal-Bench-2.0 上,Qwen3.5-35B-A3B 总提升 104%,MiniMax M2.5 提升 28%,GLM-5 提升 24%。
  • 5不同模型暴露出不同的 Harness 弱点:MiniMax M2.5 找到线索后迟迟不交付产物,Qwen3.5-35B-A3B 在工具失败后陷入重复循环,GLM-5 在 shell 会话状态和探索转实现时机上需要改进。
  • 6Self-Harness 已被 LangChain CEO Harrison Chase 转发,并被前 OpenAI 副总裁 Lilian Weng 收录进自进化 Agent 相关博客。
  • 实体识别
    公司
    上海人工智能实验室LangChain
    技术
    Self-HarnessAgent HarnessTerminal-Bench-2.0
    人物
    Harrison ChaseLilian Weng
    02

    影响与价值

    技术/商业影响、关注焦点与受影响对象

    开发者关注点

    Harness 自动优化可大幅减少手工调参和 prompt 工程的工作量

    技术颠覆

    提出 Agent Harness 自优化的三步闭环:Weakness Mining(从失败轨迹中聚类可复用失败模式)→ Harness Proposal(同一模型在限定可编辑表面上生成修改)→ Proposal Validation(held-in/held-out 双回归保守接受规则)。核心创新在于让底层模型自身参与 Harness 改进,同时用客观评测而非模型自评来把关每一次改动,突破了传统手动调优和强模型外援兜底两种范式的局限。

    商业模式

    若该方法被产品化集成到 Agent 开发平台(如 LangChain),将显著降低企业在多模型环境下部署 Agent 的工程人力成本。传统的'一模型一套人工调参'模式有望被'自动 Harness 优化'替代,可能催生 Agent 运维(AgentOps)领域的新工具链,类似 DevOps 中 CI/CD 自动化的价值逻辑。

    关键受益方

    • LangChain
    • Alibaba Cloud (Qwen)
    • 开源 Agent 框架 (CrewAI, AutoGPT)

    竞争受损方

    • 人工 Prompt 工程咨询公司
    • 以闭源 Harness 为壁垒的 Agent 平台
    • 传统 RPA 厂商
    03

    风险、机会与行动

    结合机会清单和风险矩阵判断后续关注重点

    可关注的市场机会

    • 企业可基于 Self-Harness 思路开发 Agent Harness 自动化优化 SaaS 平台,帮助部署 AI Agent 的企业无需更换基础模型即可持续提升系统性能
    • Agent 系统可靠性工程(Agent SRE)工具链方向值得投入,包括自动回归测试、Harness 版本管理和弱点模式库等配套基础设施
    • 开源社区可围绕 Self-Harness 构建模型无关的 Agent 中间件优化框架,降低多模型部署场景下的 Harness 人工调参成本
    风险信号
    监管
    如果 Self-Harness 自动修改系统提示词导致 Agent 行为偏离安全边界或绕过内容审核,可能引发 AI 安全监管关注;自动演化的 Harness 行为可追溯性和可解释性要求可能上升
    技术
    Self-Harness 依赖回归测试质量,如果 benchmark 不能覆盖真实边缘场景,Harness 可能过拟合测试集;更强的外部监督模型方案可能实现更优效果,该方法的相对优势需更多跨场景验证
    竞争
    LangChain 等主流 Agent 框架可能将类似能力内建为平台功能,挤压独立工具的市场空间;各大 AI 厂商可快速复现该思路并集成到自家产品中,先发优势窗口有限
    伦理
    允许 Agent 自修改运行策略可能引入不可预测的行为漂移;缺乏人工审核的自动 Harness 演化可能在长期运行中累积非预期副作用

    阅读导览

    点击跳转到正文区块

    NAV
    01提取事实↘02影响与价值↘03风险、机会与行动↘

    文章属性

    框架工具科技媒体已核实

    关键实体

    公司
    上海人工智能实验室LangChain
    技术
    Self-HarnessAgent HarnessTerminal-Bench-2.0
    人物
    Harrison ChaseLilian Weng

    影响对象

    受益方

    • LangChain
    • Alibaba Cloud (Qwen)
    • 开源 Agent 框架 (CrewAI, AutoGPT)

    受损方

    • 人工 Prompt 工程咨询公司
    • 以闭源 Harness 为壁垒的 Agent 平台
    • 传统 RPA 厂商

    同源文章

    上一篇蚂蚁集团、阿里云等正式加入PyTorch基金会,携手全球开源力量推动AI普惠下一篇供需失衡的窗口期里,商汤大装置把国产算力做成了正毛利生意