Harness成AI编程新战场:OpenAI开源Codex Harness,DeepSeek一周三更
2026年8月下旬,AI编程赛道的竞争焦点发生了一次肉眼可见的位移:大家不再只比谁的模型分数高,而是开始比谁的 Harness(智能体运行框架)更强。8月21日至22日的几条消息几乎撞在了一起——OpenAI 进一步开源 Codex Harness 的核心能力;DeepSeek Harness 一周内密集发布多个版本,把 Claude Code 和 Codex 收编为子代理;NVIDIA 的通用编程 Agent 系统 AVO 在 ARC-AGI-3 公开测试集上拿到 100% 满分;Anthropic 则把 Computer Use、Skills API、Files API 一并推向正式可用(GA)。TechCrunch 在评论 NVIDIA 这一成绩时写下一句相当直白的判断:真正的英雄是 Harness,而不是 AI 模型本身。
什么是 Harness:模型之外的那一层
按 OpenAI 的口径,Codex Harness 是 Codex 背后的核心 Agent 运行时环境,负责连接模型、用户和工具,管理任务执行、上下文、会话和代码操作等流程。换句话说,它不是”代码生成工具”,而是一整套 Agent 执行框架,核心包括 Agent Loop、线程生命周期与持久化、配置与认证、工具执行和扩展机制。
这次开放的关键在于 Codex App Server:开发者可以使用双向 JSON-RPC 协议,把 Harness 与不同客户端集成,获取实时事件流,从而构建 IDE 插件、桌面应用等定制化 Agent 产品。此前 OpenAI 已经开源了 Codex CLI 和相关核心代码,这次相当于把”发动机舱”也打开了。
一个值得记住的工程数据
OpenAI 在 Harness 中实践了”代码完全由 Codex 编写”的工程理念:一个内部产品在约 5 个月内生成约 100 万行代码,完成约 1500 个 Pull Request。团队核心理念也随之从”手写代码”转向”人设目标、Agent 执行”。这个数字比任何跑分都更能说明问题——工程组织方式已经变了。
DeepSeek 的选择:不做工具,做调度层
DeepSeek Harness 近期一周内发布多个版本,最引人注意的动作是把 Claude Code 和 Codex 收编为子代理。它的定位类似 OpenAI 的 Codex Harness,但更强调跨模型调度:开发者可以在单一框架内切换不同模型和工具链,根据任务类型自动选择最优 Agent 执行。
同步更新的还有工具链至 0.1.1-rc.1 版本,新增 V4-Flash-Vision-Exp 视觉模型体验版。这个模型是 DeepSeek 在 8月21日上线的实验性视觉理解模型,在 V4-Flash 和 V4-Pro 基础上扩展多模态能力,支持原生图片请求和图文混合输入,视觉 Agent 基准测试表现接近 Opus-4.8,API 沿用 V4-Flash 定价,图片最多折算 384 token。同时 DeepSeek 还推出了免费的 Files API。
把这几件事连起来看,DeepSeek 的意图很清楚:不跟你抢”最好用的编程助手”这个位置,而是抢”谁来调度所有编程助手”这个位置。这是典型的平台层打法。
四家的 Harness 动作对比
| 厂商 | 核心动作 | 关键细节 | 战略意图 |
|---|---|---|---|
| OpenAI | 开源 Codex Harness 核心能力 | Codex App Server + 双向 JSON-RPC;内部产品5个月约100万行代码/约1500个PR | 把运行时做成开发者标准 |
| DeepSeek | Harness 一周三更,收编子代理 | Claude Code、Codex 作为子代理;工具链 0.1.1-rc.1;新增 V4-Flash-Vision-Exp | 抢跨模型调度层 |
| NVIDIA | AVO 在 ARC-AGI-3 满分 | 25个环境全部100%,完成全部183个关卡 | 证明 Agent 工程能力 |
| Anthropic | Computer Use / Skills API / Files API 全面 GA | 新增 Browser Use;单次调用多步操作;达 HIPAA 合规;速率限制提升5倍,每组织1TB存储 | 做企业级 Agent 基础设施 |
Anthropic 的补位:把 Agent 能力做成企业可采购的东西
Anthropic 这次把 Computer Use、Skills API 和 Files API 一起推向全面可用,几个细节值得留意:
- Computer Use 升级:允许 Claude 在单次模型调用中执行多个连续操作,大幅减少任务完成时间和调用次数,同时达到 HIPAA 合规标准,可用于受监管的医疗健康工作负载。
- 全新 Browser Use 工具:继承多轮操作优势,并引入网页结构解析能力,能直接识别和交互网页上的特定输入框或按钮,比传统”截图+点击”方式更精准高效。
- Skills API:企业可上传和管理专有技能文件夹(含行业指令、脚本和模板),在 Claude 的代码执行沙箱中安全运行,无需企业自行托管。
- Files API:支持 PDF、表格等文件上传,通过 ID 在后续请求中引用,实现自动文件过期机制,速率限制提升 5 倍,每个组织可享 1TB 专用存储。
HIPAA 合规和 1TB 存储这类描述,说明这已经不是给极客玩的功能,而是给采购部门看的参数。
顺带一提:模型层的价格还在往下走
就在同一时间窗口,OpenAI 宣布未来 3 个月内将 GPT-5.6 Sol 的 API 与 Credit 调用价格下调 20% 以上:输入从每百万 Tokens 5 美元降至 4 美元(降 20%),输出从 30 美元降至 20 美元(降 33%),缓存输入与长上下文价格同步下调;功能已在 API 上线并面向 ChatGPT Work 和 Codex credits 方案推送,Pro/Plus/Business 订阅权益不变。
另一边,阿里云千问 AI 平台正式接入智谱 GLM-5.3 和 DeepSeek-V4-Pro 官方版本。据报道,GLM-5.3 显著增强了编程能力、长周期任务执行能力和网络安全能力,编码和 Agent 能力接近 Claude Fable5。模型能力越来越接近、价格越来越低,这恰恰是竞争必须往 Harness 层跑的原因——模型本身正在快速商品化。
对创业者和技术团队的三点提醒
- 别把技术护城河押在模型选型上。模型一个月能降价 20%-33%,能力差距在收窄,选型是可替换的决策。
- 真正的差异在运行时。上下文管理、工具调用编排、任务持久化、失败重试与人工介入点——这些工程细节决定 Agent 在真实业务里能不能跑。
- 组织方式要跟上。“人设目标、Agent 执行”不是一句口号,OpenAI 那 100 万行代码背后是研发流程、Code Review 机制和责任边界的重新设计。工具先进,流程落后,等于没升级。
FAQ
Q1:Harness 到底和普通的 AI 编程插件有什么区别?
普通插件解决的是”帮我写这段代码”,Harness 解决的是”接到一个目标后,怎么规划、调工具、管上下文、维持会话、把任务跑完”。前者是功能,后者是运行时架构。OpenAI 明确表示 Codex Harness 包括 Agent Loop、线程生命周期与持久化、配置与认证、工具执行和扩展机制。
Q2:DeepSeek 把 Claude Code 和 Codex 当子代理,实际意义是什么?
意味着开发者可以在一个框架里按任务类型自动选最优 Agent 执行,而不用绑定单一厂商。对使用方是灵活性提升,对 DeepSeek 是占据调度层位置。谁掌握调度,谁就掌握了流量分配权。
Q3:NVIDIA AVO 拿到 ARC-AGI-3 满分意味着什么?
ARC-AGI 是目前最具挑战性的通用智能基准测试之一,旨在评估 AI 系统的抽象推理和模式识别能力。AVO 在公开测试集的全部 25 个环境取得 100% 满分、完成全部 183 个关卡。行业解读的重点不在”NVIDIA 模型多强”,而在于同样的模型配上更好的运行框架,表现可以有质的差别。
Q4:中小团队现在该做什么?
建议三步:一是把内部重复度最高的研发或运营流程拆成可被 Agent 执行的明确任务;二是选一个 Harness 框架做集成而不是自己从零造轮子;三是把评测机制建起来——没有评测,你无法判断换模型或换框架是变好还是变差。价格在降,试错成本比一年前低得多,但评测能力是自己的资产。
本网站的文章部分内容来源于网络,仅供大家学习与参考,如有侵权,请联系站长 QQ:24844 进行删除处理。本站一切资源不代表本站立场,不代表本站赞同其观点和对其真实性负责。本站一律禁止以任何方式发布或转载任何违法的相关信息,访客发现请向站长举报。本站资源大多存储在云盘,如发现链接失效,请联系我们我们会第一时间更新。














![修愚分享推广计划正式上线,推广可获高额奖励[限时推广]-修愚](https://xiuyu.com/wp-content/uploads/2025/05/愚你同乐-1024x410.jpg)


暂无评论内容