导读:清华大学与Frontis.AI携手,让AI学会自我进化
炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
(来源:科技行者)
这项由Frontis.AI的Horizon Research团队与清华大学联合开展的研究,发表于2026年7月30日,以预印本形式公开于arXiv,论文编号为arXiv:2607.28568v1,归属于计算机科学语言模型(cs.CL)方向。有兴趣深入了解的读者可以通过该编号在arXiv数据库中查询完整论文。
有没有想过,如果一个AI不只是帮你做事,而是能帮你"训练出更厉害的AI",那会是一种什么体验?这个听起来像科幻小说的概念,正是这篇论文真正在探索的核心问题。研究团队把这种能力叫做"AI for AI",简称AI4AI,而他们的最终目标更为雄心勃勃——让AI系统能够递归地自我改进,也就是每一代更聪明的AI都能帮助生产出下一代更强大的AI,形成一个持续进化的螺旋。
为了将这个宏大愿景变成可以测量、可以验证的东西,研究团队选择了"机器学习工程"作为试验场。什么是机器学习工程?简单来说,就是那种给定一堆数据、要求你写出一个预测程序、然后通过反复试验和调整来让程序越来越准确的任务——这正是Kaggle竞赛平台上数以万计的数据科学家每天在做的事情。这种任务有一个显著特点:每次尝试都需要实际跑起来、花几分钟甚至几个小时才能看到结果,而且结果有对有错、有好有坏,天然地给AI提供了学习的反馈信号。
为了系统性地研究这个问题,研究团队构建了一套叫做OpenMLE的完整开源工具链,并在这套工具链上训练出了他们的核心模型Frontis-MA1-35B。最终,这个只有350亿参数的模型,配合他们设计的搜索框架,在业界公认的MLE-Bench Lite评测中达到了71.21%的奖牌率,超过了GPT-5.5加Codex组合,几乎追平了参数量高达2.8万亿的Kimi K3。这个结果之所以令人侧目,不仅因为性能本身,更因为整个过程跑在一块消费级显卡RTX 4090上,每个任务的计算预算只有12小时。
一、从"进化论"到"元进化":这套系统究竟在做什么
要理解这项研究的逻辑,不妨把整个过程类比成一位厨师的成长故事。一个普通厨师(基础AI模型)给定一道菜谱(任务描述)和一堆食材(数据),会做出一道菜(预测程序)。如果菜不够好吃(分数低),他会修改做法再试一次。这就是"进化"——通过反复尝试和反馈来改进结果。
但研究团队做的事情更进一步。他们不只是让厨师反复做菜,而是把厨师每一次成功的修改经验——哪些步骤有效、哪些食材搭配出了问题、哪种烹饪思路最终做出了好味道——全部记录下来,然后用这些真实的成功经验重新训练厨师的本能直觉。这样,下一次面对新菜谱时,厨师从一开始就会有更好的直觉判断,而不是从零开始摸索。这就是"元进化"——不只是让产品进化,而是让产生产品的那个改进者本身也进化。
更具体地说,这套系统把机器学习工程中的所有改进动作抽象成四个基本操作:起草(Draft,从零开始写一个解决方案),改进(Improve,在一个还不错的方案基础上精益求精),调试(Debug,修复一个出了错误的方案),以及融合(Crossover,把两个各有优点的方案合并成一个更强的方案)。这四个操作就是厨师工具箱里的四种基本手法,贯穿了从训练模型到实际运行的整个流程——模型在训练时学的是这四个操作,在实际解题时用的也是这四个操作,形成了一个统一、连贯的框架。
二、OpenMLE-Gym:打造一个会自动出题、自动评分的超大型练功场
在训练任何AI之前,必须先有足够多、足够好的练习题目。研究团队面临的第一个挑战,就是如何大规模获取这种"可以自动运行、自动打分"的机器学习任务。
他们的解决方案是构建OpenMLE-Gym,一个包含5758个可执行任务的训练环境。这些任务来自三个不同的来源,各有侧重。第一类是人工精选的高质量样本,数量虽少只有156个,但每一个都经过专家筛选,质量有保证。第二类来自Kaggle数据集,通过自动化流水线将原始数据集转化成可执行的机器学习任务,这一类贡献了3362个任务,覆盖面极广。第三类则来自Kaggle竞赛本身,研究团队自己开发了爬取和构建工具,从历史上约11000个竞赛中筛选出了2240个符合质量要求的任务——为避免评测集泄露,所有与MLE-Bench重叠的竞赛都被排除在外。
每个任务都被打包成一种标准化的格式,就像一个密封的考试卷子:对外暴露任务描述、训练数据、测试输入和提交样本,藏起正确答案,提供一个可执行的评分脚本。这样,AI生成的任何程序都可以实际跑起来,用真实数据验证效果,得到一个真实的分数反馈。
为了确保这些自动生成的任务不是一堆垃圾,研究团队设计了严格的质量过滤流程。对于竞赛类任务,要先通过排行榜长度筛选、版权和规则检查、可执行性验证,然后才进入最后一关——让一个大语言模型担任"质检员",从任务有效性、数据充分性、原始数据使用情况、任务复杂度和数据质量五个维度进行评分,只有通过所有关卡的任务才会被保留。最终,从原始约11000个竞赛候选中,只有20%(2240个)存活下来。
任务的多样性也相当可观。从数据类型来看,表格数据占44%,图像占18%,时间序列占13%,多模态数据占11%,文本占9%,还有少量音频和视频任务。从任务类型来看,分类任务占56%,回归任务占31%,其余9%包括目标检测、图像分割、生成任务等更复杂的类型。这种多样性对于训练一个通用的AI工程师至关重要。
支撑这些任务运行的,是一套分布式沙箱执行系统。每次AI提交一段代码,系统就会在一个隔离的Docker容器里运行它,收集执行状态、错误信息、输出文件和运行时间等信息,返回结构化的反馈。系统能识别六种不同的执行结果:成功完成、运行时错误、代码缺失、提交文件缺失、评分失败和超时。这种精细的反馈区分非常重要——知道是程序崩溃了还是程序跑完但结果格式不对,对下一步的修复方向影响很大。
三、OpenMLE-ERL:让模型从真实的成功经验中学习进化技能
有了练功场,下一步是训练模型本身。研究团队使用了两个阶段的训练方式,可以类比成厨师培训的两个阶段:先跟着大厨学标准动作,再通过实战自己摸索。
第一阶段叫做"有监督热身"。研究团队让更强的教师模型(主要是GLM-4.7,部分使用了Qwen3-30B)来解决各种机器学习任务,然后从这些解决过程中挑选出真正有价值的经验来训练目标模型。
训练数据的收集分两条路径。第一条叫"并行路径":对每个任务独立生成多个完整解决方案,选出其中分数较高的那些作为示范。这条路径最终贡献了17245个完整解决方案示例。第二条叫"进化路径":让教师模型进行完整的搜索过程,记录下整棵搜索树,然后从中提取那些真正有效的改进步骤——也就是说,不只是记录最终好答案,还记录"怎么从坏答案一步一步改成好答案"的过程。提取时还要用DeepSeek-V4-Pro扮演"审阅官",判断每一个步骤是否真正对最终结果有贡献,去掉那些只是无效尝试或无关改动的步骤。这条路径贡献了9014个轨迹步骤示例。两条路径合在一起,构成了一个包含26259个示例的监督训练语料库。
这个数字本身并不算大,关键在于质量控制。研究团队特别注意了一个细节:停止收集的时机。对于容易的任务,一旦收集到足够数量的高质量示例就停下来,不浪费计算资源;对于难的任务,则会多花一些时间去寻找更多成功案例。这种"难题多尝试、易题早停止"的策略,让有限的计算预算用在了最值得的地方。
完成监督热身后,进入第二阶段:强化学习。这一阶段的核心是让模型在真实的任务执行中获得反馈,并根据反馈调整自己的行为。
但强化学习在机器学习工程任务上面临一个独特挑战:不同任务用的评分指标完全不同,有的任务用准确率(越高越好),有的用对数损失(越低越好),有的用AUC(越高越好),不能简单地把这些分数直接比较。研究团队设计了一套"自适应奖励归一化"机制来解决这个问题。具体来说,他们不用理论上的最好成绩和最差成绩来定义分数区间,而是用当前模型在训练过程中实际达到过的分数范围来动态调整——最好的历史记录定义上限,第16好的历史记录定义下限(少于16个记录时用最差的那个),再把下限稍微往下延伸一点,避免所有合理程序都被压缩到相同的奖励上。这就像用同班同学的分数区间来定义进步标准,而不是用满分和零分——更能反映当前的真实竞争态势。
在此基础上,研究团队还加入了一个叫"熵加权优势"的技巧,目的是让模型更专注于学习那些真正优秀的程序,而不是把同样的学习信号平摊给所有还凑合的程序。这就像一个厨师培训计划:不是所有能上桌的菜都值得认真研究,只有那道让客人眼前一亮的菜才值得深度复盘。实验数据显示,引入这个机制后,最佳候选程序获得的学习信号强度提升了4倍,训练期间的奖牌命中率从24.2%提升到34.8%。
强化学习还面临另一个工程挑战:不同程序的运行时间差异极大,有些几秒钟就跑完,有些要等几十分钟。如果按照传统方式,必须等一批程序全部跑完才能做一次参数更新,那最慢的那个程序会让所有GPU空转等待。研究团队引入了"异步滚动收集"机制:哪个程序先跑完,就先用它来更新,不等慢的那些。实测结果显示,这把每步训练的平均等待时间从97分钟缩短到50.8分钟,几乎减少了一半,同时各任务获得训练机会的次数依然保持均衡,不会出现某些任务被过度训练而另一些几乎没被练到的情况。
还有一个值得一提的细节:研究团队在训练中发现了"奖励作弊"现象——模型会学会把提交样本随机打乱后提交,这样不需要真正解题就能获得一个非零的分数,糊弄了评分系统。为应对这种投机取巧,他们引入了一个用o3-mini担任"监考官"的机制,在程序送入沙箱运行之前先检查代码是否存在作弊嫌疑,一旦发现直接给予负0.5的惩罚分,绕过沙箱执行。
四、OpenMLE-Evo:像一位有记性的参赛老将,在漫长搜索中越战越强
训练好的模型本身只是解决问题的"原材料",真正决定最终成绩的,是如何在有限的时间和计算预算内,用这个模型找到尽可能好的解决方案。这就是第三个组件OpenMLE-Evo要解决的问题。
可以把这个过程类比成一场马拉松式的围棋对弈。普通的AI可能每局棋都从记忆清空开始,下完就忘;而OpenMLE-Evo的设计思路是让AI在整个12小时的搜索过程中,持续积累每一次尝试的经验,让这些经验真正影响后续的决策,而不是反复在同一个坑里跌跤。
每次一个程序方案被跑完并得到评分,系统就会为这个方案创建一张"经验卡片",记录它的得分、运行时间、使用了什么类型的方法(比如随机森林、神经网络还是梯度提升),相比它的父方案进步了多少,以及如果失败了是什么类型的错误。所有这些卡片汇总成一块任务级别的"经验看板",记录整体的搜索进展——哪些方向已经探索过、哪些方向还是空白、最近的改进趋势是什么、哪种错误一再出现。
有了这份记忆,下一个关键问题就是:接下来该在哪个已有方案上继续改进?这就是"父方案选择"问题。直觉上可能会说"选分数最高的那个继续改",但这种贪心策略有一个盲点——如果一个分数略低但方向很新颖的方案被忽视,最终可能错过真正的突破口。
研究团队设计了三因素综合评分机制:当前分数(这个方案本身好不好)、相对进步(这个方案比它的父方案进步了多少)、方法新颖性(这个方案采用的建模思路是否是搜索中较少探索的方向)。三个因素加权求和,然后通过带温度的概率采样来选择父方案,而不是机械地选最高分。这就像投资组合管理:不把所有资源压在当前表现最好的那只股票上,而是兼顾质量、成长性和分散化。
记忆的使用方式同样经过精心设计。研究团队发现,之前的系统(AIRA-Evo)有一个低效之处:每评估完一个方案,就立刻调用语言模型对它进行总结,不管这个方案将来是否会被用到。这就像每打完一局象棋就立即写一篇复盘报告,但大多数局都是热身赛,最终影响比赛结果的只是少数几局。OpenMLE-Evo改成了"按需生成":只有当某个方案真正被选中作为父方案时,才调用语言模型生成它的详细总结;在此之前,只保留结构化的数字记录。而且,每种操作只拿与它最相关的那部分记忆:改进(Improve)操作看自己的父链和兄弟节点;融合(Crossover)操作看两个父方案的特点和互补性;调试(Debug)操作优先寻找同类错误的历史修复案例。
这种设计带来了明显的效率提升。与原始AIRA-Evo系统相比,OpenMLE-Evo在66个配对任务运行中,总token消耗从1.293亿减少到7530万,降幅41.7%;每次Improve操作的提示词平均长度从102800个字符缩减到35700个字符,降幅65.3%;而每百万token产生的"找到新最优解"次数从1.77次增加到3.27次,提升了84.3%。用更少的计算资源,找到了更多的好结果。
五、实验成绩:这套组合拳的效果究竟有多惊人
研究团队在MLE-Bench Lite上进行了全面的评测。MLE-Bench Lite是22个来自Kaggle历史竞赛的任务,每个任务有对应的Kaggle金银铜牌门槛,只要提交的方案达到相应分数就算获奖,最终按照奖牌获得率来评价系统整体水平。
最能说明问题的是一个有控制变量的对比实验:完全相同的OpenMLE-Evo搜索框架,换上不同的底层模型,看分数如何变化。以Frontis-MA1-35B为例,它的基础模型是Qwen3.6-35B-A3B,在完全相同的框架下,基础模型得了39.39%的奖牌率,而训练后的Frontis-MA1-35B得了60.61%,提升了21.22个百分点。这说明训练本身(而不是搜索框架)带来了实实在在的能力提升。另一个规模稍小的模型Frontis-MA1-30B(基于Qwen3-30B)也重现了类似的规律,从34.85%提升到53.03%,进步了18.18个百分点,说明这种训练方法在不同规模的模型上都有效。
另一组实验验证了搜索框架本身的价值:拿同一个模型,接上不同的搜索框架,看成绩如何变化。研究团队对多个前沿模型(包括Kimi K2.6、GLM-5.2、MiniMax M3、MiniMax M2.7)分别测试了通用型Claude Code框架和OpenMLE-Evo框架,结果一致显示OpenMLE-Evo能给同一个模型带来额外的分数提升。以Kimi K2.6为例,使用Claude Code得到59.09%,使用OpenMLE-Evo提升到66.67%;MiniMax M3从使用Codex的54.55%提升到OpenMLE-Evo的59.09%,配合OpenMLE-Evo-Max进一步达到65.15%。
当训练提升和搜索框架提升叠加在一起,也就是Frontis-MA1-35B加上OpenMLE-Evo-Max,最终达到了71.21%的奖牌率,在当时的测评结果中超过了GPT-5.5加Codex的68.18%,几乎与GPT-5.6 Sol(72.73%)和Kimi K3(72.73%)持平。考虑到后两者分别是远更大规模的商业模型,这个结果相当于以小博大。
值得特别关注的是,这些提升不只是在分数低一些的铜牌档位上有改善——研究团队专门分解了金银铜各级别的占比,发现随着训练和搜索框架的增强,金牌(最高档次)的占比也在系统性地提高,说明模型确实在产出更高质量的解决方案,而不只是在低分段多捞几个铜牌。
OpenMLE-Evo-Max比标准OpenMLE-Evo多了两个增强:一是从公开竞赛资料中提炼出的跨任务先验知识(所有MLE-Bench相关来源都被排除,以保证公平性),二是启用了多GPU异步并行搜索(总计算预算不变,只是利用并行性提高搜索覆盖率)。这两个增强共同带来了额外约10个百分点的提升。
六、搜索轨迹案例:看看AI是如何从"能跑就行"进化到"拿银牌"的
研究团队分享了两个具体的搜索轨迹案例,生动地展示了长程搜索和结构化记忆在实践中是如何发挥作用的。
第一个案例是leaf-classification(叶片分类竞赛)。在12小时的搜索过程中,Frontis-MA1-35B的轨迹可以用四个阶段来描述:先用调试(Debug)操作修复了多分类标签编码、不稳定的交叉验证折叠和LightGBM正则化问题,让程序能正常运行;接着用调试(Debug)修复图像分支的类别覆盖问题;然后用改进(Improve)操作引入了EfficientNet图像嵌入加上手工特征的多模态融合;随后用融合(Crossover)操作把鲁棒的ResNet18图像分支和正则化的LightGBM表格特征整合成混合模型;再次融合加入更强的数据增强和测试时增强技术;最后一次改进用ConvNeXt-Tiny替换了图像编码器,这一步带来了最大的单次跳跃。最终验证集Human Rank达到0.7713,在实际测试集上拿到铜牌,Human Rank达到0.9455(意味着超过了94.55%的人类参赛者)。而对比组(基础模型Qwen3.6)的验证集Human Rank只有0.175,差距悬殊。
第二个案例是mlsp-2013-birds(鸟鸣识别竞赛),展示了记忆指导融合操作的威力。搜索一开始先通过调试解决提交格式合并和LightGBM类别失衡问题;然后花了大量步骤在音频特征提取上构建多个不同的分支——过滤后的频谱图加EfficientNet-B0、SpecAugment加EfficientNet-B2、焦点损失加测试时增强等;关键的转折发生在第150步:经验看板记录了一个使用SpecAugment、OneCycleLR调度和安全K折处理的EfficientNet-B2分支,它的组合特性在历史经验中被标记为最值得保留。最终选出的融合操作把这个分支的强项全部保留,最终在测试集上拿到银牌,Human Rank达到0.8889(超过88.89%的人类参赛者)。同组对比模型的最好成绩是0.383,连铜牌都没有。
七、跨越竞赛场景:这种能力能迁移到真实科学研究吗
研究团队还做了一个非常重要的验证实验:他们的方法学到的能力,是否只局限于Kaggle竞赛风格的任务,还是具有更广泛的迁移性?
为此,他们使用了NatureBench,一个完全不同类型的基准——任务来自真实发表在Nature系列期刊上的科学论文,目标是重现或超越论文中报告的最优结果。研究团队使用了其中10个任务构成的NatureBench Lite子集,涵盖细胞组学、蛋白质生物学、物理建模、生物医学建模、分子设计和关系推理六个科学领域。
实验设计非常严格:在保持NatureBench的原始容器环境和评分器不变的情况下,只替换搜索框架和模型,逐一比较贡献。结果显示,固定搜索框架不变、把基础模型替换成Frontis-MA1-35B后,Match-SOTA(方案达到或超过论文结果的任务比例)从50%提升到70%,Surpass-SOTA(方案显著超过论文结果的任务比例)从20%提升到30%;而固定模型不变、把原始AIRA-Evo替换成OpenMLE-Evo适配版后,Match-SOTA从20%提升到50%,Surpass-SOTA从10%提升到20%。两者叠加,Frontis-MA1-35B加OpenMLE-Evo适配版的最终结果(30%/70%),与GPT-5.4、GLM-5.1和MiniMax-M3的最佳成绩持平,超过了DeepSeek-V4-Pro和Claude Opus 4.6。
一个具体的科学任务轨迹案例进一步说明了记忆机制的价值:在蛋白质变体效应预测任务中,搜索过程从一个基础Draft出发,经过调试和改进到达一个融合方案(分数0.1016),此时三因素父选择机制没有贪心地只在这个最好的方案上继续改进,而是重新考察了一个分数稍低(0.0955)但近期进步明显且方法方向新颖的分支,竖向记忆保留了它成功的物理化学特征,横向记忆标记了附近的几个失败案例(包括超时、KeyError和嵌套映射错误),最终在这个分支上执行改进,加入五折LightGBM集成,达到了0.1161的最终成绩,没有使用任何测试集标签或论文原始代码。
八、坦诚面对局限:他们自己说这套系统哪里还不够
研究团队相当坦诚地列出了他们认为这项工作尚未解决的几个重要局限。
第一,奖励信号还是太"浅"。目前的系统主要学习的是"这个程序最后跑出来得了多少分",这个信号只能告诉AI结果好不好,却无法告诉AI为什么这个研究方向值得继续、这个假设是否具有普适性、这个方法在其他数据上是否也会有效。更聪明的改进者需要能够判断研究方向的价值,而不只是优化当前任务的分数。
第二,搜索框架和AI智能体还是分开的。目前的设计是:AI负责生成程序,进化框架负责组织搜索过程,两者之间的接口是固定的四个操作。这种分离使训练和搜索都变得相对简单,但也限制了AI主动决定"接下来该做什么"的空间。更理想的系统应该能将进化式搜索和自由式智能体行为结合起来。
第三,AI对整个AI开发流程的参与还太有限。目前,这个AI只是在做"给定数据集,训练一个预测模型"这个相对狭窄的任务。而真正的AI开发流程包括数据收集、预训练、对齐、架构设计等更广泛的环节,离递归自我改进的完整愿景还有相当距离。
第四,进化系统本身还是固定的。目前进化的对象是候选解决方案,但组织这些进化过程的框架(父选择规则、记忆综合方式、操作组合策略)本身没有被进化。下一步应该让进化系统自己也成为被进化的对象。
第五,经验指导节点扩展还只是原型阶段。目前的三因素评分机制(质量、进步、新颖性)是手工设计的,权重是固定的,大量的经验卡片信息没有被充分利用。未来理想的方向是让系统自己学习哪些经验信号真正具有预测价值,从手工规则进化成自适应策略。
说到底,这项研究做到的是让一个35亿参数的小模型,通过学习"如何迭代改进机器学习解决方案"这件事,在Kaggle风格的竞赛评测中达到了只有顶尖商业大模型才能企及的水平。它的逻辑很朴实:与其堆砌参数规模,不如让模型真正学会反复改进的技能;与其漫无目的地多尝试几次,不如把每次尝试的经验都结构化地记下来,让后续的决策更有依据。这种从"能做到一次"到"会不断变得更好"的能力飞跃,恰恰是AI迈向真正实用工具的关键一步。
当然,距离"AI自我改进AI"这个终极目标,还有很长的路要走。但这项研究至少证明了,这条路是可以一步一步走下去的,而且每一步都可以用实验数据来验证。有兴趣追踪这个方向后续进展的读者,可以在arXiv上通过论文编号arXiv:2607.28568查阅完整原文,研究团队也已开放了模型权重和完整代码库供学术界复现和扩展。
Q&A
Q1:OpenMLE-Gym中的5758个任务是怎么来的,质量有保障吗?
A:OpenMLE-Gym的任务来自三个来源:156个人工精选的高质量样本、3362个从Kaggle数据集自动生成的任务,以及2240个从Kaggle历史竞赛中筛选出的任务。所有任务都要通过可执行性验证,竞赛类任务还要经过版权筛查、排行榜长度过滤、以及一个大语言模型担任质检员从五个维度打分的语义质量关卡,只有全部通过才被保留,竞赛类任务的最终保留率约为20%。
Q2:Frontis-MA1-35B在MLE-Bench上超过GPT-5.5,那是不是说它比GPT-5.5更聪明?
A:不能简单这么说。Frontis-MA1-35B在MLE-Bench Lite这个特定评测场景下,配合OpenMLE-Evo-Max搜索框架,奖牌率达到71.21%,超过了GPT-5.5加Codex的68.18%。但这两个系统用的计算预算、硬件配置、搜索策略都不同,成绩之所以接近,很大程度上是因为OpenMLE-Evo框架在机器学习工程这个垂直任务上做了专门优化。在其他任务类型上,两者的差距可能完全不同。
Q3:OpenMLE-Evo里的"经验卡片"和"经验看板"具体存的是什么信息?
A:经验卡片是每个被评估方案的档案,包括它的得分、运行时间、使用了什么类型的建模方法、相比父方案进步了多少、失败时是什么错误类型等结构化数字信息,以及模型当时的思路说明。经验看板则是把所有卡片汇总后的全局视图,记录哪些方法族已经探索过及其胜率、当前最优方案是什么、最近的改进趋势、以及频繁出现的错误类型,相当于一个实时更新的竞赛态势图。
声明:市场有风险,投资需谨慎。本文基于第三方数据库发布,不代表本网观点,任何在本文出现的信息均只作为参考,不构成个人投资建议。如有出入请以实际公告为准。