接手一个堆满历史遗留代码的网站是什么体验?前后端换了好几拨人,代码结构臃肿,交互混乱,虚假功能遍地。

最近,硅星人搞了次有点疯的实验:让三款国产大模型——Kimi K3、Qwen 3.8-Max和GLM 5.2——一起去改造这个“屎山”网站。不是跑分,是一次真实的“屎山”救援。

六轮测试做下来,结论很直接:没有一款模型能从头赢到尾。

第一轮:谁看懂了项目当前的进展?

接手半路项目最怕的不是代码多,而是模型把旧文档当成当前需求,把已经做完的功能重新做一遍。

Qwen 3.8-Max: 10秒内完成分析,最快。像每天待在现场的监工,最准确地抓住了项目最近在做什么。

Kimi K3: 像一分钟带你看完房子的中介,讲清楚了房间布局,但把14个CMS集合数成了15个。

GLM 5.2: 像经验丰富的老师傅,对项目底层结构理解最深,但把四月份的旧方案也当成了当前施工计划。

排名:Qwen 3.8-Max > Kimi K3 > GLM 5.2

第二轮:解决网站报错

前端页面启动报错,把报错信息丢给三个模型处理。

Qwen 3.8-Max: 快人一步,直接帮我启动了CMS。

GLM 5.2: 处理速度较慢,等它准备启动CMS时公共端口已被Qwen占用,于是它直接复用了Qwen启动的服务——正确且成熟的工程判断。

Kimi K3: 只给出解决方案,没实际执行。

排名:Qwen 3.8-Max > GLM 5.2 > Kimi K3

第三轮:轮播图效果实现

要求实现无缝无限轮播,卡片持续向左移动,不能出现停顿、跳动或空白。

GLM 5.2: 功能最完整,自动播、可拖动、真循环都有。但接缝处仍然跳一下,离真正的无缝循环只差最后一点收尾。

Kimi K3: 把直线跑道改成了环形,但删掉了自动轮播功能,动画细节不够精细。

Qwen 3.8-Max: 问题最严重。它删除了鼠标拖动功能,用复制多份内容的方式伪装成循环,播放到最后一轮时卡片仍然会跳回开头。一个看起来能用的错误答案,比半成品更危险。

排名:GLM 5.2 > Kimi K3 > Qwen 3.8-Max

第四轮:修改现有功能

要求将“最新观点”板块的强调色改为科技蓝,应用于标题、序号和悬停状态。

Qwen 3.8-Max: 修改速度最快,文字颜色、背景、边框和圆角基本都处理正确。但鼠标悬停后的交互色仍然是绿色,没同步修改。

GLM 5.2: 没直接改代码,先问了两个问题确认范围。问到的地方做得漂亮,没问到的地方彻底放飞——最大卡片的悬停色是绿色,小卡片是蓝色。

Kimi K3: 只改了边框、圆角和一处颜色,其他部分几乎没有变化。

排名:Qwen 3.8-Max > GLM 5.2 > Kimi K3

第五轮:考验模型审美

不给参考答案,让模型重新设计首页Hero区域,体现科技媒体的专业感和编辑气质。

Kimi K3: 采用科技极简风,标题粗体无衬线,左侧文案加蓝色按钮,右侧加入网格、细线与柔光背景动效。科技感最强,而且主动加了动效。

Qwen 3.8-Max: 粗体极简风,超大黑色无衬线标题分三行占据左侧,背景几乎没有装饰。最像现代内容媒体。

GLM 5.2: 杂志编辑风,标题改成超大衬线斜体,加入EDITORIAL、EDITION 2026等期刊元素,形成类似纸质杂志封面结构。但科技感不够。

排名:Kimi K3 > Qwen 3.8-Max > GLM 5.2

第六轮:增加快速审核功能

完善CMS审核工作台,要求集中显示待审核文章,点击后从右侧展开详情面板,操作后立即更新列表。

Qwen 3.8-Max: 侧边详情最完整,标题、作者、提交时间、状态、分类、摘要和正文预览全部出现,底部能直接执行审核操作。

Kimi K3: 基本信息和操作功能齐全,但正文预览过于简化,用户仍需跳转到编辑页查看完整内容。

GLM 5.2: 提供了摘要和固定操作栏,但正文预览区域被巨大的图片加载失败占位覆盖。

排名:Qwen 3.8-Max > Kimi K3 > GLM 5.2

六轮积分:每个模型的真实画像

六轮测试做完,没有全能冠军。用最朴素的名次积分——第一名3分、第二名2分、第三名1分:

Qwen 3.8-Max: 优势是快,对项目当前状态更敏感。但为了快,它会删功能、用伪装方案,信任度存疑。

GLM 5.2: 像喜欢先读资料的工程师,代码结构理解最深,轮播完成最全面。但速度慢,容易被旧文档牵着走。

Kimi K3: 带来最多意外。分析时最简洁但数字错误最多,修改前端常漏要求,却在CMS任务中第一个完成。像灵感好的设计师,又像没耐心做完检查的实习生。

这次实验告诉我们的

第一,模型能力不是固定属性。 同一款模型在不同任务类型上的表现差异巨大。Qwen在快速响应和状态感知上最强,但在需要精细前端实现的任务中会用“看起来能用”的方案糊弄。GLM对底层结构理解最深,但旧文档会拖慢它的判断。Kimi在创意任务上最亮眼,但在细节执行上容易漏项。

第二,选模型要看具体活。 需要快速响应和状态感知?选Qwen。需要深度代码理解和稳定实现?选GLM。需要创意和设计感?选Kimi。没有放之四海而皆准的“最强模型”。

第三,AI接管“屎山”是可能的,但需要人盯着。 这次实验证明,三款模型都能在真实遗留代码库上完成有价值的改造工作。但模型各有短板——Qwen会删功能、Kimi会漏细节、GLM会被旧文档带偏。AI可以做“屎山”的施工队,但图纸审核和验收还得人来干。