全国
热门城市
我的位置: 首页 > 资讯 > >> 正文

AI自己出题自己练!两个月狂涨11%,编码自测反超Opus 4.8

新智元 2026-08-27 11:23:32

新智元报道

训练一个能干活的模型,最贵的不是显卡,是训练题。


(资料图)

尤其是到了编码和智能体这一档,光有题目和答案根本不够用:还要给它准备一套跑得起来的环境,一份判得了对错的测试,还要防着模型翻旧提交抄答案。

难度也不能瞎给。

太简单,模型闭着眼做完,什么也没学到;太难,一道都不会,攒不下正确的经验,等于白烧一轮算力。

这些全凑齐了,还得凑够量。

过去这活一直是人在干。慢、贵不说,主要是供不上:你刚整理完一批,模型转头就做完了。

那让模型自己给自己出题呢?

真有人这么干了。

今年8月,Ornith一口气放出397B MoE、35B MoE和9B Dense三档权重。

训练流程里多了一个前所未有的环节:模型自己生成训练任务,自己搭解题脚手架,自己跑解题轨迹,三段一起丢进强化学习。

出题这件事,AI从人手里接过去了。

数字立刻给出了回报。

Terminal-Bench 2.1上,两个月前的1.0是77.5,这次的397B跑到86.1。两个月,涨了8.6个百分点。

同一张表里,Ornith给出的Claude Opus 4.8成绩是85.0。

一个能随便下载的MIT权重,在这张表上排到了闭源旗舰前面。

1.0学怎么解

1.5学练什么

今年6月的Ornith-1.0,已经干过一件挺激进的事:把agent脚手架,也就是AI解题时用的工作台,变成了可学习的对象。

通常的做法是,人类工程师给某一类任务设计好一套脚手架:工具怎么给、任务怎么拆、出错怎么重试,全写死,然后让模型在这个固定框架里反复刷。

1.0把这套框架拆了,交给模型自己搭。

每个强化学习步骤分两段:先根据任务和上一轮用过的脚手架,改出一版新的;再在这版脚手架上跑解题轨迹。奖励从轨迹回传,两段都拿得到。

Ornith-1.0的两段式自我提升框架。先改脚手架,再跑解题轨迹,奖励回传两段。

模型学会了搭工作台。但活儿还是人派的:题目从哪来,1.0没碰。

1.5把这一环也接了过去。

给定一个代码库,一段关于任务类型的高层说明,再加上模型自己过去的解题记录,系统先生成一批新题,专挑比它已经做出来的更难一档的,戳自己的能力缺口。

题定下来,模型再为这道题生成或改进专属脚手架:指令、工具、拆解策略、编排逻辑。

最后在任务和脚手架的双重条件下,跑出解题轨迹。

奖励从轨迹反向传回全部三段,一起用GRPO优化。

关键在于出卷这一半也要打分。题出得不好,出题的那一半照样扣分。

出题、搭台、解题,在这一刻闭环了。

策略越强,出的题越难越有信息量;脚手架进化,越能把模型的本事榨出来;轨迹质量上去,又反过来喂出更狠的学习信号。

过去两年,开放模型追赶闭源旗舰基本就两条路,堆参数,抄配方。

两条都是照着别人的卷子抄答案。Ornith不想抄了。它要的是AI自己出卷。

自己出的题

怎么保证不是废题

听上去很美,但很快就能想到破绽:模型要是给自己出送分题呢?

奖励往哪儿高,模型就往哪儿漂。一个只会出「1+1等于几」的出题人,能把分数刷爆,训练信号却一点都没有。

Ornith的办法是把任务奖励拆成三个信号:有效性、前沿难度、新颖性,三者相乘。

相乘是关键。任何一项接近零,整道题的奖励归零。想拿分,三项必须同时成立。

有效性管的是这道题成不成立:

脚手架跑不跑得起来,高置信度的正确解能不能通过,明显错误的解会不会被判失败,判分逻辑跟任务描述对不对得上。

团队干脆把它当硬门槛,不合格直接判零,专拦那些看着很难、其实根本判不出对错的废题。

前沿难度,是整套设计里一个亮点。

系统对每道题采样若干条轨迹,算出经验成功率,越接近0.2这个目标值,奖励越高。

也就是说,一道好题,模型十次里应该做成两次。

做成八次,说明它已经会了,没有训练价值;一次都做不成,连一条能学的成功轨迹都攒不出来,强化学习同样空转。

卷子必须踩在模型刚好差一口气的位置上。

更妙的是,这个靶子会随着模型能力动:某类题做熟了,成功率上去,奖励自动往下掉,出题端只能继续加码。整条难度曲线自动爬升,不用人再去调。

新颖性排第三,权重也最低,只负责一件事:别老出同一道题的变体。

官方特意注明它的优先级低于前两项,职责是去冗余,并非奖励怪题。

所以这套「自我提升」,真正提升的是课程的自动演进。

整套流程发生在训练阶段。

你从Hugging Face下下来的那份权重是死的,它不会在你的笔记本或者手机上一边干活一边改自己。

两把不同的尺子

先说清86.1是怎么来的。

这个Terminal-Bench 2.1成绩,是Ornith团队在自己的环境里、用自己的配置跑出来的,官网写明取五次独立运行的平均值。

而Terminal-Bench 2.1自己有一张官方验证榜单,每一条结果都由榜单团队成员亲自复跑、核验之后才挂上去。

截至2026年8月19日,那张榜单一共17项,里面没有Ornith-1.5。

Terminal-Bench 2.1官方榜单前八。Opus 4.8以78.9%排第5,17项里没有Ornith-1.5。

更要紧的是对比对象。

Ornith表里的Opus 4.8成绩85.0,是他们自己用Terminus-2框架给Opus 4.8跑出来的数。而官方榜单上,Anthropic提交的Claude Code加Opus 4.8,经核验是78.9%,排第5;榜首是Claude Code加Fable 5的83.8%。

同一个Opus 4.8,两张表相差6.1分。

区别是谁在测、用什么测。

Terminal-Bench这类智能体基准,测的是模型、脚手架、超时、上下文和资源配置的组合成绩。

换一套配置,分数就换一层含义。

所以,榜单页面上挂着一条提交规则:不得修改超时或资源配置。就是为了不让参赛方靠调配置把分数刷上去。

Ornith博客披露的自测配置是4小时超时、32核CPU、48GB内存。

另外还动了配置,包括官方点名锁死的超时和资源。

这些改动未必是冲着刷分去的,但可比的前提已经没了:项目自测和官方验证榜,不能放进同一个排名里读。

许可证这一层同样要说清楚。

MIT标的是权重。公开的GitHub仓库目前主要是README、LICENSE和展示素材,没看到1.5完整的训练实现、训练任务集,也没有可复现的评测脚本。

开放权重,不等于全套开源。

最有意思的其实是35B和9B

旗舰负责上热搜,中小尺寸才决定有多少人真的用得上。

这次发布里,最容易被忽略的,是中间那两档。

35B-A3B是个MoE,每个token只激活约3B参数。

就这个激活量,Terminal-Bench 2.1跑到67.8,对比Gemma 4-31B的42.1和Muse Glimmer-30B的51.7高出一个身位。SWE-bench Verified上79.0对52.0。

3B激活打赢31B稠密模型,是这次发布里最划算的一款。

比它更小的那一档,9B Dense则是摆明了要冲端侧的那一档。

自测Terminal-Bench 46.2,SWE-bench Verified 70.6,GPQA Diamond 86.4。

Hugging Face上,5.63GB的压缩版已经放出来了,苹果电脑用的MLX格式也有。

但9B也不是全面压过Gemma 4-31B。

编码和推理项上它确实领先,MCP-Atlas却是54.2对55.0,Toolathlon-Verified是41.2对52.8。

这两项考的是多轮调工具、接住返回结果、按状态改计划,链条一长,9B的容量就撑不住了。

编码和推理能靠训练方法把体量差补回来,工具调用补不回来。

下一场竞赛

可能在题库

6月的1.0,Terminal-Bench自测77.5。8月的1.5,86.1。

两个月,提升了约11.1%。

比这个数字更重要的,是它背后的能力是怎么长出来的。

1.0学的是「怎么解」,1.5开始学「该练什么」。数据生产这道工序,被整个搬进了强化学习的闭环。

高质量的智能体训练任务,一直是稀缺品。

人工整理的速度,早就跟不上模型吃题的速度。这套机制冲着解决的,刚好是这个很具体的工程问题。

开放模型追赶闭源旗舰的方式正在切换。

堆参数和抄配方之外,多了一条路:自己造题。谁能持续造出好题,谁就握着持续变强的燃料。

Ornith-1.5的三段闭环。生成任务、生成脚手架、跑出轨迹,奖励回传三段,统一用GRPO更新。

模型的上限,除了拼算力,还要拼题库。

只是当出题、搭台、解题都交给模型,人类留在这个闭环里的位置是什么?

参考资料:

https://ornith.ai/ornith_1_5.html

https://ornith.ai/ornith_1_0.html

https://www.tbench.ai/leaderboard/terminal-bench/2.1

编辑:元宇

该作品系作者结合新闻时事、法律法规及互联网相关知识整合,作品内图片源于网络。仅供交流学习,若侵犯到您的权益,烦请联系客服告知,我们核实后将立即删除。 标签: 信号 智能体 训练题

最近更新

AI自己出题自己练!两个月狂涨11%,编码自测反超Opus 4.8 AI自己出题自己练!两个月狂涨11%,编码自测反超Opus4 8,信号,智能体,训练题
英媒:波普已经被明确告知,如果留在纽卡他将是第三门将-头条焦点 英媒:波普已经被明确告知,如果留在纽卡他将是第三门将,马蒂亚斯,纽卡
郭士强:世预赛中国队有信心迎战卡塔尔队 8月26日,中国队主教练郭士强(右二)和球员们在训练中。新华社发(尼
国家能源局:2026年7月风电核发绿证7760万个,交易绿证2784万个 国家能源局:2026年7月风电核发绿证7760万个,交易绿证2784万个,一、绿
2800吨化肥“出仓”直发黑龙江!贵州铁路“运仓配”模式开启首次跨省“大考” 贵阳网·贵阳新闻讯8月23日凌晨,满载2800吨磷酸一铵的48009次列车从贵
8月27日生意社PMMA基准价为14333.33元/吨 焦点滚动 8月27日,生意社PMMA基准价为14333 33元 吨,与本月初(14833 33元 吨)
生意社:8月27日强美矿业萤石价格走势暂稳 8月27日浦城县强美矿业有限公司萤石出厂价格暂稳,厂家报价为3700元 吨
快资讯丨匈牙利保克什核电站恢复满负荷运行 (记者刘艺炜)匈牙利总理毛焦尔·彼得26日表示,在多瑙河水位回升...
丹阳市界牌民峰五金灯具厂(个体工商户)成立 注册资本50万人民币-最新 天眼查App显示,近日,丹阳市界牌民峰五金灯具厂(个体工商户)成立,
今日快看!祥生医疗:融资净买入107.22万元,融资余额9432.16万元 交易所最新数据显示,祥生医疗于2026年8月26日获融资买入232 27万元,
恒为科技:融资净偿还51.61万元,融资余额5.14亿元_今日快讯 交易所最新数据显示,恒为科技于2026年8月26日获融资买入1298 67万元,
距圣徒揭幕战18天:历代18号球衣球员全名单 距圣徒揭幕战18天:历代18号球衣球员全名单,特里,韦德,威尔逊,圣徒揭幕战
皇马4:1胜皇家社会,穆氏皇马7大球星闪耀,1名球员发挥不佳 皇马4:1胜皇家社会,穆氏皇马7大球星闪耀,1名球员发挥不佳,西甲,皇马
百融智能-W(06608.HK)完成配售合共3739.35万份认股权证 百融智能-W(06608 HK)发布公告,配售事项的所有先决条件已获达成,且配
美东汽车(01268)发布中期业绩 股东应占亏损2.75亿元 同比收窄66.19% 智通财经APP讯,美东汽车发布截至2026年6月30日止6个月中期业绩,收益7
致欧科技:拟发行可转债募资不超过5.14亿元 致欧科技:拟发行可转债募资不超过5 14亿元人民财讯8月26日电,致欧科
常熟农商行上半年归母净利润21.78亿元,净息差降至2.48%_即时焦点 8月26日,常熟农商行发布2026年半年度报告,数据显示,报告期内,该行
速腾聚创上半年营收超10亿元,同比增长30.2% 8月26日,速腾聚创(02498 HK)发布2026年中期业绩公告。公告显示,上
速腾聚创上半年营收超10亿元,同比增长30.2% 8月26日,速腾聚创(02498 HK)发布2026年中期业绩公告。公告显示,上
进球网:因为C罗喜欢散步、不防守,利雅得胜利要换下他! 进球网:因为C罗喜欢散步、不防守,利雅得胜利要换下他!,c罗,利雅得,
图解财报:星宸科技上半年归母净利润8.63亿元,同比增长619.50% 每日快看 星宸科技8月27日发布2026年中报显示,公司上半年实现营业收入26 58亿元
焦点关注:新华保险:已在全国42个城市布局了61个优质康养社区 8月26日,新华人寿保险股份有限公司(以下简称“新华保险”)发布20...
当前热议!8月26日北向资金最新动向(附十大成交股) 交易所最新数据显示,8月26日北向资金共成交2555 69亿元,占两市总成交
训修实业(01962.HK)8月26日耗资337.58万港元回购675.6万股|快看点 格隆汇8月26日丨训修实业公告,8月26日耗资337 58万港元回购675 6万股
观焦点:江苏:鼓励生物医药企业围绕新产品研发、新技术应用、新业务布局等积极增资扩产 江苏:鼓励生物医药企业围绕新产品研发、新技术应用、新业务布局等积极
【播资讯】江苏:鼓励生物医药企业围绕新产品研发、新技术应用、新业务布局等积极增资扩产 【江苏:鼓励生物医药企业围绕新产品研发、新技术应用、新业务布局等积
动态:里昂:维持华润医药(03320)“跑赢大市”评级 目标价下调至6.5港元 智通财经APP获悉,里昂发布研报称,维持华润医药(03320)“跑赢大市...
中来股份: 2026年上半年亏损3.45亿元 中来股份(300393)8月26日披露2026年半年度报告。2026年上半年,公司
观热点:栖霞建设(600533.SH)上半年净亏损6.27亿元 格隆汇8月26日丨栖霞建设发布2026年中报显示,公司上半年实现营业收入7
每日热闻!中国电建:二级市场股价受多重变量共同影响 证券之星消息,中国电建(601669)08月26日在投资者关系平台上答复投资者

律师最新回复

  • 2023-03-29 16:54:32

    小额担保贷款有什么用途?哪些项目属于微利项目?什么是小额担保贷款?

  • 2023-03-29 16:54:32

    小额贷款如何贷?小额贷款不还最终有什么后果?工行个人小额贷款的条件是什么?

  • 2023-03-29 16:54:32

    贷款需要什么条件?贷款买车与全款的区别是什么?贷款买车手续费一般是多少?

  • 2023-03-29 16:54:32

    怎么应对高利贷行为?什么是高利贷?高利贷款利息怎么算?

  • 2023-03-29 16:54:32

    申请无抵押贷款的方式有哪些?北京企业无抵押贷款如何申请?

我是律师

律师入驻

 

律所合作请联系客服

服务时间 9:00-18:00

友情链接:

京ICP备2023000331号-26        投诉举报:315 541 185@qq.com

Powered by 名律网 Copyright © 名律网版权所有