Qwen3.8、Kimi K3与GPT-5.6 Sol三款大模型被实测用一句话生成“雷霆战机”网页小游戏:Qwen3.8仅实现基础射击功能;GPT-5.6 Sol侧重视觉包装与品牌化界面;Kimi K3表现最优,支持火力升级、星盾、炸弹等主动技能与成长系统,体现更强的游戏逻辑理解与交互设计能力。测试表明,大模型竞争已从参数和基准测试转向真实工作流介入能力。
过去一周,Qwen3.8-Max-Preview 与 Kimi K3 接连亮相,把国产大模型的参数规模推向2万亿级以上。
不过,大模型之争早就过了单看Benchmarks、只看参数的版本。能够切实介入日常的工作流,才是衡量基模能力的最好标准。
对此,Biteye今天决定是驴子是马,拉出来溜溜。
同样是“一句话做个Biteye风格的雷霆战机网页小游戏”的提示词,Qwen3.8、Kimi K3、gpt5.6 sol三个模型交出了完全不同的答卷:
Qwen3.8:能动,也仅限于能动
GPT-5.6 Sol:视效好看,像品牌官网
Kimi K3:花活最多,游戏感最强
⚠️温馨提示:由于 Kimi K3因为算力限制不再开放订阅,本次测试最终由WorkBuddy调用。
https://x.com/i/status/2079865420576927996
🔗:试玩Qwen3.8版本
打开Qwen3.8版本,第一感觉是:逗我呢?
深蓝色背景,中间一个并非Biteye原生的Logo,一个“开始游戏”按钮。标题里的黑色文字与深色背景融为一体,仿佛提前开启了隐身模式。
点进游戏后,基础功能倒是勉勉强强:
鼠标拖拽战机
自动发射子弹
红色三角形敌机
分数统计
撞机与结束机制
实测中,战机可以持续射击,分数也一路涨到了858,Qwen3.8至少跑通了。
可问题是,整个游戏像一个刚搭好的Canvas Demo:敌机是三角形,子弹是光点,玩法基本没有变化。没有任何武器成长、没有任何道具系统,也没有明显的关卡节奏。
就像Qwen团队自己宣布的那样,Qwen3.8的后训练还没有做好,正在“按天迭代中”。
显然,美术和策划还没进群。
https://x.com/i/status/2079865420576927996
🔗:试玩GPT-5.6 Sol版本
打开GPT-5.6 Sol版本打开,气势一下就上来了。
左边是鲜明的任务,中间是战斗区域,右边是可视化雷达和遥测模块。深色背景配荧光青,再加上中英文混排和Biteye品牌元素,非常有007特工仪表盘的视觉感。
它的系统也比Qwen丰富不少,譬如:
Wave波次
Armor装甲
Overdrive状态
Combo连击
最高纪录
暂停功能
鼠标和键盘双操作
实测中,游戏成功运行并拿到了922分。失败后不会简单地弹出“Game Over”,而是显示“战机离线”,重新开始则叫“重新连接”。从开始到结算,文案和视觉都保持着同一套世界观,这一点还蛮fancy的。
不过,GPT-5.6 Sol的问题,就是太会做包装了。左右两侧的信息面板占据了大量空间,真正的游戏区域反而被压在中间。它更像一张完成度很高的品牌活动页,里面顺便嵌了一款小游戏。
相比Qwen3.8,gpt-5.6 sol的美术、品牌和运营全部到岗,不过游戏策划显然是摸了点鱼。
https://x.com/i/status/2079865420576927996
🔗:试玩Kimi K3版本
Kimi K3的首屏虽然没有GPT-5.6 Sol那么惊艳,但游戏说明一出来,味道就不一样了:
W:火力升级
S:星盾
B:炸弹
H:修复
空格:释放炸弹
P:暂停
M:静音
进入游戏后,还有三条生命、火力等级、炸弹数量、暂停按钮和声音开关。
另外两个版本还在慢吞吞地解决“飞机怎么移动”,Kimi K3已经开始考虑玩家捡到道具之后怎么玩了。
这也是三个版本最明显的差距:Qwen做出了射击功能,Sol做出了视觉包装,Kimi则主动补上了道具、资源、成长和主动技能。
当然,它的画面仍然不算精细。敌机和特效大多是简单的几何图形,部分Logo素材贴得也比较直接。但作为一款小游戏,它最懂得不断给玩家新东西。
三个模型,分别招进哪个部门?
如果把三个模型当成新员工,这次测试大概是这样的:
一句话生成游戏,拼的早就不只是代码
以Biteye的雷霆战机测试为例,现在让大模型写代码,做一个“飞机会移动、子弹会发射”的网页并不难。
但真正拉开差距的是,模型在前置逻辑训练后,会不会主动设计反馈、关卡、道具、成长和视觉主题。大模型不仅要理解代码,还要真正理解,玩家为什么愿意再玩一局。