AI技术文章

分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA

作者:AI Dancer0 次浏览 来源:AI Dancer
分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA

刚读了一篇 AI4AI 论文《AI4AI at Scale》,来自 XYZ Agentic Team。还是第一次听到这个 Lab。他们用 AI4AI 的方式做出了两个很强的搜索 agent,也公开了方法。借这篇 paper 讲讲 AI4AI 到底怎么工作,下面尽量少堆术语。

刚读了一篇 AI4AI 论文《AI4AI at Scale》,来自 XYZ Agentic Team。还是第一次听到这个 Lab。

他们用 AI4AI 的方式做出了两个很强的搜索 agent,也公开了方法。借这篇 paper 讲讲 AI4AI 到底怎么工作,下面尽量少堆术语。

文章配图

他们的视频播客里披露:十几名员工,配上约 400 个 Agent Workers,两个月做完了这套 Deep Search 系统(这 400 是整个项目里参与分析、开发、实验和评审的执行单元,具体任务再临时组队)。

文章配图

① 先把它想成一个准备考试的学生

就像学生可以改学习资料、换解题方法、调整计算器,分析自己上次为什么答错。但永远不知道标准答案、也不知道阅卷规则。最后,新方法到底有没有用,由一位独立考官测试,考过保留,没过就退回。

论文把这套考场规则叫optimization contract。人类先写清楚要提升什么能力、允许 agent 改哪些部分、每轮能用多少资源、什么情况必须停。AI optimizer负责找问题和试新方案,isolated evaluator像独立考官,只给分数和必要的错题反馈,不泄露答案;gate决定这次修改是保留、拒绝,还是交给人判断。

每轮实验都会写进shared experience memory。成功方法留下,失败方法也留下,并注明当时用了什么数据、工具和评测版本。这个 memory 由 agent 自己维护,作用很像学生时代的错题本

我也看了他们在youtube的访谈,访谈把 memory 讲得比论文更具体。

它实际上分两层:第一层:保存所有原始日志,用于审计、复现,以及从任意 checkpoint 重启;第二层:把日志整理成结构化经验,比如当时看到了什么、证据链是什么、人类有没有介入、方案为什么通过或被拒绝。

更有意思的是,经验也有保质期。搜索工具和网页一变,过去有效的方法可能就失效了,系统会自动重新 review,把过期经验标出来。

所以严格来说,它不只是错题本,更像一本会自动修订旧答案的实验室 Wiki。

文章配图

整套流程叫 AI4AI,核心是一个四步循环:Research → Development → Review → Record

文章配图

  • Research像研究员做复盘。AI 看上一轮分数、失败案例、历史实验和人类意见,判断问题出在数据、训练,还是工具与运行方式,再提出一项能验证的改动。但它不能天马行空:可改范围、预算和风险边界都写在 optimization contract 里,隐藏答案也看不到。
  • Development是把方案做出来,产出一个待测新版本,但不能提前偷看独立评测,更不能碰 gate。太贵的方案可以先跑便宜的小实验,过筛只说明“值得继续花钱”,离上线还远着。
  • Review才轮到独立验收。isolated evaluator 用同一套版本化规则比较新旧版本,gate 只给accept、reject、escalate三种结果,模糊、高风险或越界的情况交给人。提方案的人不能顺手改阅卷规则,更不能自己签字上线。
  • Record是给实验室写档案。无论成败,代码、数据、prompt、模型与评测版本、资源、trace 和评审意见都要留下,连同适用条件一起写进 shared memory,下一轮才不会重踩旧坑。

他们管这套东西叫bounded-exploration AI4AI。核心逻辑:人定义好目标、预算和边界,AI 在这个框里自己诊断、自己改、自己测试,但最终能不能合并进主分支,那张门禁卡还是捏在人手里

② 这个框架真正拿来做 Deep Search agent 时,主要做了三件事

第一,搭一条自动命题流水线。

普通 QA 搜一个关键词就能找到答案,训不出真正的搜索能力。但人工出难题太慢,一天写几百道就到头了,喂不饱训练。

所以团队干脆把出题这件事本身也自动化了:先把抓来的网页连成一张证据图,网页是节点,超链接和引用是边;再从图里随机捞一个连通子图,把散落在几个页面上的证据拼成一道题;最后自动把题面里直接出现的人名、日期、机构换成间接线索,比如不说“2021 年”,说“在那家公司搬到新总部的第二年”。

整条线不需要人坐在那里出题,所以能一直往下跑,源源不断产出必须多跳查找、还得自己做消歧的搜索任务。模型靠背关键词是过不了的。

第二,只让模型学习“它当时真的看见了什么”。

长任务里,后台完整档案可能保存了所有搜索结果,但 agent 当时脑子里的东西早被压缩或折叠过,早期搜到的网页,可能只剩一句摘要。

如果训练时把完整档案都喂给它,就像学生考试时只看到半页材料,复盘时却拿着整本答案在学。学的时候什么都齐全,真上考场又只有半页,自然对不上。

所以训练数据必须严格对齐它做任务时实际能看到的版本,包括摘要过的、折叠过的那部分历史。

第三,工具和复盘系统一起改。

agent 始终只有三个工具:search固定返回 top-10,scrape负责取网页内容,python在单个任务里保留变量和文件。系统同时保存完整档案和 agent 每一步实际看到的版本。

这样答错的时候,能分清到底是没搜到、网页没抽对、旧证据被挤掉了,还是证据明明在眼前却没用上

结果:

  • XYZ-Aquila-mini(基于 Qwen3.6-35B-A3B):在小于 40B 的 open-weight 组里,七个 benchmark 全组最高,比如 LiveBrowseComp48.7,下一名 41.4。
  • XYZ-Aquila-pro(基于 Qwen3.5-397B-A17B):小于 400B 组的六项全部领先,WideSearch81.2,下一名 75.6。对比更大的闭源前沿模型时,也在BrowseComp-ZH、LiveBrowseComp、WideSearch 拿到最高分。

文章配图

③ 全文我觉得最有意思一件事:AI 自己提出了人类没想到的改法

团队原本觉得,让 agent 自己决定什么时候整理 context,会增加它的负担,所以这个方案根本不在人类最初的尝试清单里

结果 AI 分析历史日志后,主动提出了active compact:由 search agent 自己判断什么时候该整理上下文、保留哪些证据,并且把方案实现了。人类只负责验收效果,以及检查有没有 ground truth 泄漏。

这个例子非常重要。它第一次具体回答了:AI4AI已经超出“替人跑实验”了:从失败记录里看出问题,提出人没想到的方向,然后自己动手做出来。

④ AI4AI 和 AutoML 到底差在哪

这个问题他们博客里专门写了。

AutoML通常是在预先划定的空间里,优化模型架构、训练方式和参数。AI4AI改的是包含模型在内的整套系统:数据怎么造、工具怎么调用、harness 怎么运行、评测怎么做、infra 怎么优化,都在范围内。

而且 AutoML 更像按数值规则不断试参数,AI4AI 会读历史实验、总结失败原因、参考人的意见,再决定下一轮改哪里

这两年AI4AI一直是海外前沿实验室探索的重点。

2025 年OpenAI用 PaperBench 测 agent 能否从零复现 20 篇 ICML 论文,8316 个任务,最好成绩 21.0%,低于 ML PhD 基线。到 GPT-5.6,模型已经参与完整研发循环:诊断故障、改训练、跑实验、解释结果,再去改另一个模型。半年里 coding inference 研究算力涨了100 倍,agentic token 涨了约22 倍

Anthropic那边,部署了 9 个 Claude Opus 4.6 实例做Automated Alignment Researchers。在一个很窄的 weak-to-strong supervision 任务上,PGR 做到0.97;但迁移到 production-scale 的 Claude Sonnet 4 之后,没有统计显著提升

所以AI4AI 确实已经走进研发流程了。也很高兴看到国内也有同样前沿的成果。

论文:https://xyz-lab.ai/blogs/ai4ai-at-scale/assets/bounded-exploration-ai4ai-system-optimization.pdf

团队访谈:https://www.youtube.com/watch?v=aC7BhGGQUPo&t=792s

文章来自于微信公众号 “AI Dancer”,作者 “AI Dancer”

相关主题

读完之后

加入 AINRK 交流群

了解加入交流群的方式,与更多 AI 从业者交流。

查看交流群说明(在新窗口打开)