
如果将主流大模型粗暴地分为前沿模型、轻量模型,可以说,对于大多数普通人而言,日常真正能够当生产力工具的模型,必然还是后者更为实惠、耐用。
所以对于老狐来说,一直以来我都觉得轻量模型是 AI 行业非常重要的一个发展方向,今年下半年,随着 DeepSeek V4 flash 正式版的发布,现在 Flash 这种轻量模型也变得越来越强了。

而就在上月底,腾讯和智谱先后发布了各自最新的两款模型:Hy4 preview 与 GLM 5.3 Flash,在老狐看来,都算是能够在日常生活工作中大量使用而不心疼的轻量模型。

但是老狐也注意到,有许多网友表示不清楚两款模型哪一个用来办公干活更靠谱,担心用的模型水平,反而把自己坑了。

所以,最近几天老狐就特地针对 Hy4 preview 与 GLM 5.3 Flash 两款模型设计了 3 轮真实场景的对比测试,从办公资料的整理、一句话生成游戏,到真正可运行的小程序,为大家尽可能全面地呈现两个模型真实的工作场景的表现到底是什么样的。
对比测试不易,如果大家喜欢的话,欢迎点赞、分享~

测试环境
为了保证本次测试的公平,老狐特地做了一些控制变量的设计,比如本期的测试软件均采用 WorkBuddy,中途不更换软件,确保模型在 Agent Harness 一致的情况下自主输出结果。

同时,老狐向两款模型输入的提示词也保证完全一致,避免因为提示词的原因导致模型面临不公平的比较。
其余的方面也均采用了完全一致的设计,比如同样为最高、1M 上下文窗口的模型配置、在同一台电脑中运行、输入的文件资料也完全一致,所以大家可以放心阅读~

PPT 生成
如果说工作中最烦人的是什么,莫过于领导突然丢过来几个不同的文件,然后说:「把这些文件在下班前整理成一个 PPT。」
有时不仅是文件的内容晦涩难懂,而且文件的形式还千奇百怪,从 Word 文档到 Excel 表格,甚至还有不可编辑的 PDF。

所以本着真实测试的原则,老狐准备了以上这 3 种文件的资料试一试,看看 AI 能不能一次性将这些文件整理成不仅美观,而且可靠的 PPT。
本次使用的提示词如下:

从执行速度方面来说,两个模型没有拉开明显的差距,Hy4 preview 为 04:13,GLM 5.3 Flash 则是 04:28,在速度方面,两者可以说是完全平手。
既然速度拉不开差距,那么我们就直接快进到看产物的环节。
首先,Hy4 preview 出现了较为严重的单页幻灯片的内容显示不全问题,专业一点说叫做内容超出页面容器、被错误截断,多个页面都出现了该问题。
因此在内容完整性方面落后于没有出现此问题的 GLM 5.3 Flash。

不过图中也暴露出两款模型的另一个问题:图表存在绘制长度与具体数据不符的问题。
虽然两者在 PPT 中写出的数字没有问题,都是完全正确的,但是在图表绘制中,GLM 5.3 Flash 的条形图出现了长度和数值对应不准确的问题。
Hy4 preview 则是坐标轴的高度与标注的数值存在数据偏差,比如年中的几个月份柱高都是错误的。


视觉设计方面,不得不说 GLM 5.3 Flash 统一的深色科技风格和完善的动画很适合用于会议演示。
而 Hy4 preview 抛开缺少过渡动画不说,其整体的页面信息密度更为合理,不至于过密,整体观感更舒适,因此 Hy4 preview 的视觉设计更胜一筹。
总的来说,在幻灯片方面,老狐认为 GLM 5.3 Flash 表现更为出色,因为它保证了信息呈现的完整性,虽然在视觉方面没有 Hy4 preview 亮眼,但是扎实可靠的信息呈现风格也足以保证任务的及格分。

小游戏生成
在这个环节,老狐为两款 AI 安排的任务是一次性生成我们 90 后的童年回忆——90 坦克大战。
对于 AI 来说,生成一款可以直接游玩的小游戏并不轻松,因为它不仅涉及到游戏美术资源的绘制,而且由于游戏内判定机制比较复杂,所以对 AI 的逻辑能力和编码能力要求都比较高,这也是能够直观体现一款模型的编码能力的方式。

游戏方面,Hy4 preview 在美术设计方表现出了极高的“天赋”,不但整体画面设计美观,连带经典的草地、海洋板块的设计也很精致、贴近真实游戏的细节表现。

但是很可惜的是,Hy4 preview 在代码逻辑能力方面的表现一般,尽管能够正常进入、开始游戏,但是由于 Hy4 preview 将坦克炮弹的体积写错了,所以原本能够通过打碎砖块通过的区域,通通无法通过。
这使得玩家的坦克只能在家里呆着,完全出不了门。
而 GLM 5.3 Flash 的表现则是另一个极端,美术还原度方面做得比较一般,和原版 90 坦克大战的差距很大。

但是在游戏完整性方面做的非常出色,无论是可以被正常击碎的砖块、无法通过的海洋,或者可以躲藏的草丛,都做到了与原版游戏的 1:1 还原,而且不同颜色的坦克还有各不相同的血量,做到了完整的可玩性。
尽管 Hy4 preview 的美术表现力很出色,但是碍于游戏完全不可玩,所以老狐认为 GLM 5.3 Flash 在此环节理应得到更高的分数。


微信小程序开发
很长一段时间以来,开发 APP 都是一个非常难的事情,即便是微信小程序也需要从 0 开始学习如何开发。但如今有了 AI,越来越多的人都可以很轻松地开发一款自己使用的微信小程序。
而使用一段提示词,能不能一次性开发出一个可以使用的待办事项小程序呢?这便是该测试环节要实测的事情。

在进行具体的对比之前,同样先看一下两者的耗时差别。GLM 5.3 Flash 是 4 分 24 秒,Hy4 preview 是 4 分 09 秒,依然是没有特别大的差距。
不过两款模型开发的小程序,在体验方面,老狐看来还是有比较大的差距。
Hy4 preview 开发的小程序虽然看着没有很强的设计感,但是小程序的界面布局比较清晰,而且没有 UI 的错位和遮挡。功能经过测试是完全正常可用的,这一点可以给一个好评。

而 GLM 5.3 Flash 不仅页面存在 UI 错位问题,会导致输入框中的文字被添加按钮遮挡,而且页面的字号还存在比较混乱的问题,字号大小更随心所欲。

所以无论是功能的可用性,还是 UI 层级以及设计细节的把控,整体来说,Hy4 preview 在这一方面的表现更好。

总结
总的来说,目前 Hy4 preview 在 UI 设计方面的表现比较出色,从幻灯片的美术风格到对 90 坦克大战原版游戏细节的还原度,还有大方美观的小程序,都做得比 GLM 5.3 Flash 更好,比较适合需要制作简单的数据展示文件和网页设计的美化。
但是在复杂数据文件的呈现完整性和游戏完整性方面,GLM 5.3 Flash 则表现得更好,能够稳定可靠地将复杂、长时间的任务执行好,更少需要人工干预解决完全不可用的问题,比较适合软件功能的开发、幻灯片的初步制作。
编辑:YX

