【模型评测-程序员鱼皮】智谱首个视觉模型实测,夯还是拉?

这篇文章(作者:程序员鱼皮)核心是实测智谱首个原生多模态模型 GLM-5.3-Flash(即此前匿名爆火的“Ox-Alpha / 牛来”模型),结论偏正面:它不是旗舰级天花板,但是把“前沿能力 + 原生视觉 + 极低价格”打包在一起的高性价比 AI 编程牛马模型

一、模型身份与硬指标

  • 前身:OpenRouter / OpenCode 匿名模型 Ox-Alpha,上线首日登顶、终结 DeepSeek 56 天霸榜。
  • 架构:320B 总参数 / 18B 激活​ MoE,45 层,稀疏+线性注意力混合,1M 上下文,MIT 协议开源,跑在 10 万张国产芯片上。
  • 多模态:GLM-5 系列首个原生多模态,视觉从预训练融入,不是后接视觉模块。
  • 跑分:Artificial Analysis 智能指数 57 分,持平 Claude Opus 4.8,高于 DeepSeek V4 Pro(53)。
  • 价格:API 约 输入 0.8 元 / 输出 2.8 元(百万 token),是 Opus 4.8 的约 1/40,比涨价后的 DeepSeek V4 Flash 也便宜,Coding Plan 非高峰积分减半。

二、实测三个项目(用官方 ZCode Agent + 浏览器/电脑控制)

  1. 复刻 Apple Vision Pro 官网
    • 先 Firecrawl 抓结构 → 浏览器截 8 张图分析排版/动效 → 写代码 → 12 轮自截图对比修正,19 分钟交付。
    • 无官方素材下用 SVG 手绘产品图,深色科技感、双导航、文字节奏还原度高。
  2. 全栈 AI 绘图工具(自然语言 → draw.io XML)
    • 46 分钟,左对话右 draw.io 画布,支持连续对话改图。
    • 偶发 XML 转义错误(AI 生结构化代码通病);综合体验好于 DeepSeek V4 Pro,略逊 GLM-5.3 旗舰版和 Kimi K3 的前端精致度
  3. 3D 联机拳击游戏《牛来格斗》(Three.js)
    • 喂 6 张角色原画 → 分析造型提取 4 角色 → 搜拳皇/街霸机制 → 做移动/连招/必杀/血条/KO/选人界面。
    • 2 小时 14 分,4 轮开发-截图验证循环,靠截图抓出“树全堆在擂台中央”的视觉 bug
    • 本地双人可玩、必杀特效到位;局域网联机状态同步没完全打通(WebSocket 长程弱项)。

三、作者核心判断

  • 最大亮点:原生视觉进 Agent 循环——“写完代码自己截图看效果再修”,对前端/UI/游戏复刻是质变。
  • 定位:不是 GLM-5.3 旗舰替代品,而是日常 Coding Agent 默认款:绝大部分任务能扛,极致质量切旗舰。
  • 成本:三个中高复杂度项目跑下来不到 10 元(Coding Plan Pro 周额度耗 8%),比同任务量 DeepSeek V4 Pro/Flash 便宜一截。
  • 横向排位(作者主观):视觉编程体验 GLM-5.3-Flash > DeepSeek V4 Pro;纯后端精细度 GLM-5.3 旗舰 > Flash;XML 稳定性 Flash ≈ Kimi K3

一句话总结:GLM-5.3-Flash 是“能自己看屏幕的便宜牛马”——57 分 Opus 级智商、1/40 价格、原生多模态、开源可自部署,适合做 AI 编程/UI 复刻/轻量全栈的主力,但复杂实时后端和极限质量仍交给旗舰模型。​

2 个赞

鱼皮好熟悉的名字

1 个赞

我看过很多他的视频
我个人感觉他的技术一般般,但是口播有特色,听个乐子,挺好的

2 个赞

b站上的编程知识分享up主

2 个赞

sql教学网页 :folded_hands:

1 个赞

一个技术博主。

1 个赞

鱼皮这个人在他还在腾讯的时候我就关注他,但是自从他离职自己创业公司之后,我感觉他这个人为了流量开始出卖粉丝,标题党之后就拉黑了

1 个赞

有一点点,不过他的账号分享的AI咨询还是比较新的,公司要活有商业化行为正常,评测类的可以看

1 个赞