基座不变能力大涨,开源大模型为什么越来越能打?
- +1 你赞过了
开源模型的进化,总在不断打破人们对它的能力预期。DeepSeek R1的出现证明了推理能力可以通过强化学习涌现出来,而非只能靠堆数据、堆参数堆出来;Kimi K3则把长上下文理解、多工具串联与长程任务执行能力做了大幅升级,让开源模型具备了处理复杂企业级工作流的潜力,摸到了生产级应用的门槛。而GLM-5.3在基座不变的前提下,通过后训练策略的纵深扩展,把智能上界推到了超出行业预期的位置。
8月19日,GLM-5.3 API正式上线。距离这款模型正式发布不过短短数日,但其传递出的信号早已超出了单次版本迭代的范畴。
与前代GLM-5.2相比,它的基座模型没有任何变化,仅凭极致的后训练Scaling,就在编程体感上实现了50%的提升。主打真实终端环境复杂任务执行的Terminal-Bench 3.0得分从4.6跃升至28.3,考察长周期软件工程迭代与代码持续修改的DeepSWE v1.1得分从46.2提升至66.9,覆盖多类专业场景、看重跨工具协作与长程任务推进的Agents' Last Exam得分从23.8增长至28.5,囊括44种职业、衡量高价值知识工作能力的GDPval-AA v2更是拿到1769分。多项核心基准实现跨越式增长的同时,模型甚至涌现出接近顶级闭源模型的网络安全审查能力。
不换基座只换打法
过去数年,大模型的演进主线始终围绕“基座升级”展开。行业的共识是,更强的能力必然来自更大的参数规模、更多的预训练数据、更高的训练算力。每一次代际跃迁,几乎都伴随着一次完整的基座重训:7B、13B、70B、千亿参数,参数规模一路走高;通用语料、代码数据、多模态信息,预训练数据的广度与深度不断扩张。
这种路径有其必然逻辑:预训练决定了模型的能力天花板,基座的底子直接决定了后续对齐的上限。但随着大模型技术进入成熟期,这条路径的边际效益正在快速递减。一方面,千亿级基座的训练成本动辄数亿甚至数十亿元,投入门槛高企,绝大多数厂商无力参与;另一方面,单纯堆参数带来的通用能力提升,越来越难转化为真实场景下的体感增益。用户感知最明显的编程、智能体、专业任务等场景,恰恰不是单纯靠预训练就能拉满的。
于是,行业的竞争主轴开始开始发生变化。
第一个清晰的趋势是:基座模型进入多代复用周期,后训练工程成为能力提升的战场。
R1与K3已分别从推理强化与架构创新两条路径,验证了后训练对模型能力的撬动效应。到了GLM-5.3这里,这条路径被推向了更极致的形态,完全沿用前代基座,仅通过数十倍扩展的长程任务环境、更丰富的环境类型和超长时长的强化学习,就实现了代际级的能力跨越。
背后的支撑,是一整套后训练工程体系的成熟。基于IndexShare、SAO以及持续演进的新一代Slime框架,智谱在与前代完全相同的基座上高效推进强化学习……当这些技术组合起来,后训练就成为真正释放模型潜力的关键工序。
这带来的行业影响是深远的。它意味着大模型的迭代速度可以大幅加快,成本可以显著降低。不需要动辄数月的基座重训,基于成熟基座持续做后训练优化,就能不断推出能力更强的新版本。同时,模型能力的打磨可以更精准地指向真实场景:要提升编程能力,就把训练环境扩展到完整的软件工程流程;要强化Agent能力,就增加更多跨工具协作的长程任务。相比预训练阶段的大水漫灌,后训练更像精准滴灌。
当然,这并不意味着基座不再重要。GLM-5.3能挖潜如此之深,本身就证明了GLM-5.2基座的潜力足够深厚。但行业的重心已经从做出一个好基座,转向了把基座的潜力充分挖掘出来。
场景才是最终战场
第二个趋势与之相伴相生:模型能力的竞争,正在快速延伸到工具生态与场景落地的比拼。
当后训练让不同模型的核心能力快速趋同,单纯的跑分榜单已经不足以拉开差距。真正决定一款开源模型行业影响力的,是它能不能嵌入真实的工作流,有没有完整的工具生态支撑。
这一点在GLM-5.3的发布中体现得格外明显:模型发布当日,官方编程工具ZCode、效率工具AutoClaw同步上线,TraeWork、扣子、CodeBuddy等十余个主流编码平台同步开放抢先体验。模型能力不再是孤立的API接口,而是通过各种工具直接送到开发者的工作台上。
这是开源模型下半场的典型特征:比拼的不只是模型本身的能力上限,更是能力触达用户的效率。闭源模型可以靠官方工具打造闭环体验,而开源模型的优势恰恰在于生态的开放性,更多的第三方工具、更多的场景适配、更多的定制化可能。谁能先建立起最繁荣的开发者工具生态,谁就能把模型能力转化为实实在在的用户黏性和行业渗透率。
从更深层看,生态竞争本质上是场景定义权的竞争。当一款模型成为某个场景的事实标准,所有的工具、插件、解决方案都会围绕它构建,形成强大的网络效应。编程场景如此,企业智能体场景如此,网络安全场景同样如此。模型厂商要做的,是要和生态伙伴一起,把模型能力拆解到具体的工作环节里,让用户“用得上、用得好、离不开”。
换个角度看,后训练能力的升级,本身也在倒逼生态的成熟。当模型能独立完成工作量相当于人类工程师数天的软件工程任务,能端到端推进复杂项目,它就成为了一个协作的伙伴。对应的,围绕它的工具链也必须从代码补全、单文件生成,升级到项目管理、环境交互、持续迭代的全流程支持。生态的厚度,最终决定了模型能力的落地深度。
开源安全破局之道
但能力的快速跃升,也必然带来一个绕不开的问题:开源模型的安全边界在哪里?
当开源模型的编程能力接近顶级闭源模型,当它能端到端推进复杂项目,甚至能协助安全团队挖出潜伏数十年的底层漏洞,它的双刃剑属性也会愈发凸显。当然,差距同样存在:在漏洞利用等更深的安全环节上,开源模型与闭源前沿之间仍有明显的追赶空间,这一点官方评测也并不讳言。能力越强,被滥用的风险就越高;开放程度越高,安全管控的难度就越大。
这也是为什么GLM-5.3在宣布开源的同时,花了大量篇幅讲安全体系建设。外层分类器拦截大规模滥用请求,推理监控器实时审查任务意图,深度安全对齐让模型自主拒绝攻击性请求,三层防护体系的目标,是在释放防御能力的同时,尽可能限制攻击能力的扩散。而“开源的盾”计划,则是把强大的能力导向正向的安全防御,让更多开源项目和中小企业能获得顶级的安全审计能力。
这其实也为整个开源行业指出了方向:负责任的开源,才是开源模型下一阶段的底层共识。能力越强,越需要清晰的安全边界;生态越繁荣,越需要统一的安全底线。后训练不只要提升模型的能力,也要强化模型的安全对齐;生态建设不只要追求场景覆盖,也要构建安全防护的基础设施。
从行业发展的长周期看,安全能力的分配失衡本身就是最大的风险之一。顶级的攻防技术长期集中在少数闭源厂商与大型机构手中,意味着数量更多的中小企业、开源项目与基础设施,始终处在防护能力的洼地。但反过来,如果毫无保留地开放,又可能让攻击能力快速扩散,反而造成更大的风险。平衡的关键,就在于有边界的开放、有防护的开源。通过技术手段区分攻击与防御意图,把高风险能力管控起来,把防御能力普惠出去。
写在最后
上半场拼的是基座的高度,下半场拼的是挖潜的深度、生态的广度与安全的厚度。当技术竞争从单点突破转向体系化比拼,属于开源的下半场,才刚刚开始。
最新资讯
新品评测
X
微博认证登录
QQ账号登录
微信账号登录