| 模型迭代催化密集,行业景气度持续,智谱GLM-5.1 尤为突出近期模型层更新频率显著加快,从智谱GLM-5.1 正式发布、DeepSeek 界面预热,到谷歌Gemma 4 开源、GPT Image V2模型的相关信息,密集的迭代节奏持续验证AI 行业的高景气度,为下游应用生态提供了源源不断的动力。 GLM-5.1 的发布无疑是本轮密集催化中最具分量的事件。这款模型实现了AI 从“回答问题”到“完成项目”的质变。最震撼的案例来自一次实际测试:GLM-5.1 用一整晚的时间,独立构建了一个完整的Linux 桌面系统,全过程历时8 小时,执行了超过1200 个步骤,最终交付的系统功能完备,相当于四名开发人员一周的工作量。在另一项CUDA Kernel 优化任务中,它通过14 小时的不间断自主迭代,将加速比从2.6×推至35.7×——而此前人类资深CUDA 工程师完成同样的任务需要数月反复调优。这一突破意味着AI Agent 的长程任务应用(如自动化编程、自动化测试、长期运维)的可行性大幅提升。 在权威基准测试中,GLM-5.1 的表现同样令人瞩目。业内最具代表性的SWE-Bench Pro、Terminal-Bench 2.0、NL2Repo三项代码评测基准综合**均分显示,GLM-5.1 拿下全球模型第三、国产模型第一、开源模型第一的成绩。 GLM-5.1 在定价策略上也持续体现了模型实际能力。模型聚合**台OpenRouter 显示,智谱GLM 再度提价10%,调价后在Coding 场景的缓存命中Token 价格已接近Anthropic 旗下Claude Sonnet 4.6 水**,这是国产大模型首次在核心场景实现与海外头部厂商的价格对齐。这已是智谱近期第三次涨价——今年2 月GLM-5 发布后Coding Plan 涨幅30%起,3 月GLM-5-Turbo 再涨20%,4 月GLM-5.1 继续提价10%,但客户接受涨价并持续选择服务,说明**台模型能力确实具备领先优势。 DeepSeek V4 方面,尽管正式发布节点尚未确认,但近期信号已十分密集。4 月8 日凌晨,DeepSeek 在网页版和App中低调上线了分层模式界面,输入框上方新增“快速模式”和“专家模式”两个入口,同时还有一个带图标的“视觉模式”选项正在灰度测试。快速模式主打即时响应,适用于日常对话;专家模式针对复杂推理和深度任务;视觉模式则标志着多模态能力的深度集成,可直接处理图像与视频分析任务。根据界面选项推测,新系列可能命名为DeepSeek V4Lite(快速版)、DeepSeek V4(专家版)以及DeepSeek V4 Vision(视觉版),且至少有三款不同侧重的大模型在同步推进,全部基于国产AI 芯片构建算力底座。 谷歌Gemma 4 的发布同样为开源生态注入了强劲动能。4 月2 日,谷歌DeepMind 正式发布Gemma 4 开源模型家族,一口气推出E2B、E4B、26B-A4B、31B 四款型号,从能塞进手机的2B 到可以单卡跑满的31B,四个尺寸全覆盖,全部基于Gemini 3 同源技术打造,并且采用了Apache 2.0 开源协议——相比前代饱受诟病的自定义协议,这次谷歌彻底放下了姿态。最令人震撼的数据是:31B Dense 在Arena AI 文本排行榜上以Elo 1452 高居开源第三,排在它前面的模型参数分别是它的20 倍和30 倍——用三十分之一的体量,打出了同等水**的成绩。从实测数据看,Gemma 4 数学能力从Gemma 3 的21.2%暴力拉升68 个百分点至89.2%,编程能力从29.1%翻了两倍多至80%,智能体t2-bench 从6.6%升至86.4%,多语言推理和知识问答全线飙升40%以上。Gemma 4 的核心意义在于:它将闭源旗舰的核心能力下放到了开源模型上,为开发者社区提供了低成本、高性能的本地部署选择。 风险:地缘政治冲突、AI 应用落地低于预期、宏观下行导致企业科技采购预算下降等 |