全球人工智能大模型竞争正在进入高速迭代阶段。8月14日,中国人工智能企业智谱正式发布新一代开源模型GLM-5.3,并宣布该模型在多项主流评测中达到当前开源模型领先水平,其编程能力和智能体能力已经接近国际顶级闭源模型Claude Fable 5。这一发布不仅展示了国产大模型技术进步,也进一步加剧了全球AI领域围绕性能、成本和开放生态的竞争。
智谱方面介绍,GLM-5.3虽然在基础模型架构上延续了GLM-5.2,但通过大规模后训练Scaling技术实现能力跃升。此次升级重点集中在更长周期任务处理、更丰富环境适应以及超长时间训练等方向,使模型在复杂任务执行能力方面获得明显提升。
智谱表示,GLM-5.3当前在多个主流测试榜单中排名领先,是目前表现最强的开源模型之一。特别是在软件开发、智能体执行以及复杂推理任务方面,该模型展现出接近国际先进模型的能力,实际编程体验甚至超过部分国产同类模型。
相比上一代版本,GLM-5.3主要强化了三方面能力:更强的软件编程能力、更完善的网络安全能力,以及更加开放的开源生态。
在真实终端环境任务测试中,GLM-5.3表现出明显提升。在用于衡量模型完成复杂计算机操作和终端任务能力的Terminal-Bench 3.0测试中,GLM-5.3得分从GLM-5.2时期的4.6提升至28.3,实现大幅增长。
在重点考察长期软件工程能力、持续代码修改能力的DeepSWE v1.1测试中,GLM-5.3成绩由46.2提升至66.9,显示出模型不仅能够生成代码,还能够理解复杂项目环境,并持续完成工程级开发任务。
此外,在覆盖多个真实职业场景、强调跨工具协作和长期任务执行能力的Agents' Last Exam测试中,GLM-5.3得分从23.8提升至28.5。而在覆盖44类职业、测试真实知识工作能力的GDPval-AA v2测试中,GLM-5.3获得1769分,体现出AI模型从简单问答向专业任务执行方向发展的趋势。
除了编程能力,网络安全能力也成为GLM-5.3的重要升级方向。智谱表示,在代码审查、漏洞发现以及安全分析任务中,GLM-5.3已经达到较高水平,并在部分测试中接近国际先进模型表现。
根据智谱公布的数据,在CyberGym安全测试中,GLM-5.3能够从白盒源代码出发,通过分析程序异常发现潜在漏洞,并完成漏洞验证任务。该模型最终获得84.5%的成绩,高于GLM-5.2时期的77.2%,同时略高于Mythos 5的83.8%以及GPT-5.6 Sol的83.6%。
不过,智谱也指出,网络安全能力涉及代码审查、漏洞验证、漏洞利用以及真实攻防环境等多个阶段,目前GLM-5.3的优势主要集中在漏洞分析和验证等前端环节,完整安全攻防闭环能力仍需要继续提升。
与此同时,国产AI大模型市场近期正在迎来密集更新,多家企业相继发布新版本,加速全球人工智能竞争。
8月13日凌晨,DeepSeek正式推出DeepSeek V4 Pro,并同步更新API服务。新版本重点增强Agent智能体能力,在多个测试项目中相比此前Preview版本实现明显提升。其中,在AI编程智能体测试DeepSWE中,DeepSeek V4 Pro-0813版本成绩从Preview版本的7.3提升至62.7,表现甚至超过部分国际先进模型。
DeepSeek方面还宣布开放首款智能体开发框架DeepSeek Harness开发者预览版,并采用MIT协议开放源代码。该系统采用插件化设计理念,将模型、工具、技能、存储、沙箱、调度以及用户界面等能力模块化组合,为开发者提供更加灵活的AI智能体开发环境。
与此同时,国际市场也在持续推进模型升级。SpaceXAI推出Grok 4.6版本,新模型重点提升长流程任务处理能力,以及复杂交互、视觉理解和知识型工作任务表现。
从智谱GLM-5.3、DeepSeek V4 Pro到其他全球AI模型更新可以看出,大模型竞争已经从单纯比拼参数规模,转向比拼实际应用能力、成本效率和生态开放程度。过去由少数国际科技巨头主导的人工智能市场,正在迎来更多来自中国企业的挑战。
尤其是在开源路线快速发展的背景下,中国AI企业正在通过更低部署成本、更开放的技术生态以及持续提升的模型能力,推动全球人工智能产业重新洗牌。未来,谁能够在复杂任务执行、企业应用落地以及开发者生态建设方面取得优势,谁就可能在下一阶段AI竞争中占据更重要的位置。