对标 Opus 4.8,价格只有 1/40,刷屏 X 的牛来模型实测
对标 Opus 4.8,价格只有 1/40,刷屏 X 的“牛来”模型实测
如果你经常刷 X ,一定被一个叫 Ox-Alpha 的匿名模型刷过屏。
中文社区给它起了个更接地气的名字:“牛来”模型。
上线 OpenRouter 后,调用量一飞冲天,稳居周榜第一,消耗 23.2T tokens,成为最受欢迎的模型。
知名开源软件 OpenCode 上也创了历史记录,6 天调用 42T tokens,打破了 DeepSeek Flash 长达 56 天的记录。
昨天,谜题终于揭晓,这个“牛来”模型来自智谱。
(跟谷歌等模型都没关系,哈哈哈)
正式名称叫 GLM-5.3-Flash,320B 总参数,仅激活 18B,这是 GLM-5 系列的首个原生多模态模型。
另外支撑这个模型每天上 T 用量的,竟然都用的是国产卡!!!
GLM-5.3-Flash 模型参数只有 320B,但能力超 GLM-5.2,与 Opus 4.8 水平相当。
全球权威的 Artificial Analysis Intelligence Index(AA综合智能指数)得分 57 分,与 Opus 4.8 分数相同。
注意,最关键的来了!限时折扣价是 GLM-5.3 的1/20, Opus 4.8的1/40。
过去,大家默认前沿智能就是贵,贵是进步的代价,想用最好的模型就得掏最多的钱。
今天,这个逻辑被智谱打破了,物美也可以价廉,新的价格屠夫诞生,大模型斩杀线再次拉高。
老规矩,上实测案例。从简单的开始,建议先收藏再看。
一句话从 PDF 生成企业官网
把朋友发产品年册 PDF 直接转成一个企业官网。
上传PDF,输入提示词:
基于这个 PDF 的内容,帮我做一个纯日文的企业官网,文案要地道自然(不是机翻腔)。视觉要精美大气、有高级感,PC 和手机都能完美适配。要有一个好用的询盘表单,网站要考虑SEO和GEO。
PDF 是纯图的,GLM-5.3-Flash 多模态就发挥作用了,自动 OCR 识别、裁切素材。
生成网页后还能自己检查排版布局,不得不说, 大模型有眼睛后的感觉真棒啊!
一句话生成带真实图片的PPT
不少朋友知道,乔帮主喜欢听摇滚乐,有段时间尤其喜欢极端金属。
主要是听个热闹,今天试着生成个 PPT 来学习下这个风格的演变历史。
测试用的ZCode,它竟然会调用MCP一张张找真实乐队成员照片、专辑封面,连字体都选了极端金属常用的荆棘体。
第一版生成,看部分页面布局有点乱,发现模型自己调用 Browser Use Agent 检查调整,相当聪明、省心。
提示词如下:
制作一套介绍极端金属发展史的拼贴撕纸风 PPT,按照时间顺序梳理重要时期、子流派、代表乐队及经典专辑。 整体视觉参考地下金属 Fanzine、磁带交易网络 时代的复印海报、DIY 演出传单与黑金属经典专辑封面:使用炭黑、纸张灰白、血红和少量惨白/金属银,搭配撕裂纸边、复印失真、荆棘与倒十字符号、烛光与雾气、鲜血泼溅质感、网点印刷和潦草手写批注。画面可以粗粝、阴郁、极具攻击性,但版式必须有秩序,避免素材杂乱堆叠——用克制的排版去承载暴烈的内容。 内容从新浪潮英国重金属 与硬核朋克的源头讲起,依次介绍极端金属的裂变与演化: 1980s 初期:Thrash Metal(激流金属)——Metallica、Slayer、Kreator,速度与愤怒的觉醒 1980s 中后期:Death Metal 雏形与 First Wave Black Metal——Venom、Bathory、Celtic Frost,从亵渎美学到极端化 1990s 初期:Death Metal 黄金期——Death、Morbid Angel、Cannibal Corpse,佛罗里达与瑞典两大阵营 1990s 中期:Second Wave Black Metal——Mayhem、Darkthrone、Emperor,挪威地下场景与其争议历史 1990s 后期至 2000s:Doom / Funeral Doom、Melodic Death、Grindcore、Technical Death 的分化 2000s 至今:Post-Metal、Blackgaze、Deathcore 与极端金属的全球地下延续 每个时期用代表乐队照片、专辑封面、演出传单和一句时代宣言构成主视觉,并简要说明音乐特征(音墙、嘶吼、blast beat、失谐调弦等)与社会/亚文化背景。使用贯穿全篇的时间轴表现子流派之间的继承与更极端化的反叛。 标题使用粗犷的哥特体或几乎无法辨认的 logo 化字体(呼应极端金属经典乐队 logo 的荆棘化风格),关键信息辅以清晰无衬线字体保证可读性,批注可用潦草手写体或打字机字体。动画模拟纸张覆盖、撕开、闪烁与快速切换,可带轻微失真/噪点,但保持克制。 最终效果应像一本被反复翻阅、页角磨损的地下金属收藏册:粗粝、阴郁、真实、极端、有态度,同时具备高级的编辑设计感——暴烈但不廉价,混沌但有掌控。
一句话生成 Omarchy Linux 界面模拟
最近 X 上,开源 Linux 操作系统 Omarchy 4.0 特别热。
一句话生成 Web版模拟 Omarchy 操作系统的界面,除了 Hyprland 自动窗口布局交互没 Get 到,其他都像模像样。
Terminal、记事本、计算器、主题设置,Super + K 快捷键都模拟出来了。
提示词如下:
Clone the Omarchy linux desktop environment in the browser with HTML/CSS/JS, including window decorations, a taskbar, and a working launcher.
在浏览器中克隆出 Omarchy Linux 桌面环境,包含 HTML/CSS/JS 元素,还包括窗口装饰、任务栏以及可正常使用的启动器。
一句话生成在线版 Excel
这是 Reddit 上的一个测试用例,试着跑了下,果然可行,不仅支持公式,还能生成图表插入、导出CSV。
提示词如下:
Recreate a web-based spreadsheet editor with a formula bar, cell grid, auto-sum , sort/filter, and chart insertion .
重新创建一个基于网页的电子表格编辑器,包含公式栏、单元格网格、自动求和功能、排序/过滤功能以及图表插入功能。
一句话生成各种小游戏
免费视频素材网站随便找了一个视频:一个人第一视角骑摩托车林间穿行。
灵机一动,测下 GLM 5.3 的视频理解能力,让它做一个摩托车骑行游戏,效果如下:
除了手有点抽象外,游戏操控感不错,玩起来还有点紧张。而且跑在赛道中间速度快,出界就变慢的设定也很合理。
顺手生成了一个《沙罗曼蛇》横版射击游戏,设计了Boss,可惜手残打不到。。
作弊直接看最后关卡,Boss 长这个样子:
提示词如下:
用原生 HTML5 Canvas + TypeScript(不依赖 Phaser 等任何游戏引擎)实现一个可直接运行的经典横版卷轴射击游戏《沙罗曼蛇》,用 requestAnimationFrame 搭建固定时间步长的游戏循环。 完整实现横向自动卷轴、玩家飞船的八方向移动与连发子弹、敌机的编队波次生成、子弹与敌机/地形的碰撞检测和爆炸效果,以及经典道具强化系统(Power-up 胶囊:加速、导弹、双发、镭射、护盾 Option)。 关卡包含蜿蜒的洞窟地形——上下起伏的岩壁用地形碰撞判定,撞壁即坠毁,考验穿梭走位;关卡末尾进入 Boss 战,实现经典的火焰龙/脑核 Boss(多段血量、弱点部位、分阶段弹幕攻击模式,击破后爆炸并结算通关)。 图片和音效资源全部配置化(支持占位符或 Base64 内联),若无素材就直接用 Canvas 绘图 API 手绘像素风的飞船、敌机、洞窟岩壁、Boss 和爆炸。 代码模块化、关卡与 Boss 攻击模式用数据配置、含可调参数注释(滚动速度、弹速、刷怪节奏、Boss 血量等),浏览器打开即玩、稳定 60fps。
AI自动剪辑:电影解说《楚门的世界》
抖音上有各种 3 分钟看完一部电影,但多数都是人工剪辑。
能不能用 AI 自动剪呢?既然 GLM-5.3-Flash 是多模态模型,得让它发挥优势。
经过一下午的探索,终于找到一种相对稳定,也不用自己下载原片的 AI 自动剪辑方式,成片如下:
虽然字幕有点小(可调),开源音频 TTS 模型欠佳 ,但整体节奏和画面匹配度都很不错。
一开始给了腾讯视频播放地址,但提示版权问题,无法下载视频剪辑。
后来下载了 33 台词网 App,让它写了一个 Cli 实现搜索下载电影片段。
最好玩的是音频 TTS 生成,它从本地大模型配置中找到了硅基流动,从里面找到 CosyVoice2 模型,用于生成中文解说旁白。
算了下成本:33台词网会员一个月只要29块,送5000积分,一部剧只用200左右积分;GLM-5.3-Flash 的Token消耗只有十多万,几乎不费啥钱。
以后接上更好的 TTS 模型,任意电影生成3分钟解说,是不是立马能当电影解说博主了啊?哈哈哈。
为啥既便宜又好用?
官方给的 Benchmark 表现,DeepSWE v1.1 比 Claude Opus 4.8 高!
官网显示 5 折限时两周,真·价格屠夫,百万 Tokens 输入0.4元/输出1.4元,命中缓存只要 0.115 元。
GLM-5.3-Flash 折扣版,形成新的大模型斩杀线…
GLM-5.3-Flash 这次用了全新模型结构:稀疏注意力与线性注意力混合架构。
技术细节不展开,列几个点:
- 采用稀疏注意力 + 线性注意力的混合架构。线性注意力用递归机制抓局部依赖,稀疏注意力靠轻量级索引器召回全局上下文。
- 通过 IndexPool 把索引器缓存压到了四分之一。
- 跟 GLM-5.3 比,注意力计算量和 KV 缓存分别降了 3.01 倍和 4.44 倍。
- 30T token 的多模态预训练语料,原生支持 1M 上下文。
更多说明见官方公告:
读完发现,价格能压到这个份上,不是靠补贴烧出来的,是架构和算力一起构建起来的。
官方提到 GLM-5.3-Flash 的全部线上流量,由数万张国产芯片扛起,单日 token 处理量拉满,承接全球负载。
背后是国产算力芯片第一次这么大规模地“集体出海”。
证明国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求,牛逼!
之前 X 上还有人猜是 Nvidia 给的计算资源,纯属胡扯…
GLM-5.3-Flash 已经正式面向全球开源,MIT 协议开源,300B 参数规模,所有国产卡都能部署。
写在后面
从“牛来” 匿名爆火,到智谱正式认领。
这些天,大家猜得相当热闹,甚至有谷歌的人出来蹭热度,当然,也有人骂过度营销。
**新架构 + 国产卡 + 新斩杀线,**接力 DS-V4-Flash,被智谱跑通了。
当一个能力对标闭源旗舰的开源模型,把价格压到对方的 1/40,而且是用数万张国产卡实打实撑起来的时候。
“前沿模型太贵用不起”的叙事,可能真的要翻篇了。
另外,GLM-5.3-Flash 现已接入 ZCode 等编码平台,纳入 GLM Coding Plan(每天限量发放10,000张体验卡),同步开放API 调用,直达链接:
BigModel开放平台(国内):
-
(海外):
GLM Coding Plan(订阅套餐):
ZCode(代码工具):


