2026年美加墨世界杯刚刚落下帷幕,腾讯云作为背后的云直播服务商,支撑了全球17个国家和地区的官方赛事直播,覆盖亚太及国内三分之二的官方授权平台。腾讯云副总裁、国际产品技术负责人李郁韬在近期采访中透露了一个关键信号:这届世界杯,AI第一次大规模进入了直播生产。

画质增强、智能导播、自动剪辑、智能横转竖、质检溯源——这些以往需要大量人工操作的环节,如今已由AI全自动完成。一场世界杯的赛事支持,不过是AIGC开始迈入大规模生产应用的一个切面。

一、为什么单一模型搞不定视频?

在生成式AI的浪潮下,多媒体应用面临多重挑战。直播、点播、媒体创作、多媒体互动等场景,受限于网络传输、视频画质、用户体验以及各类特性的叠加——单一模型往往只能解决一部分问题。

李郁韬观察到,很多厂商看到新的多模态大模型后,第一件事就是全部对接一遍,今天对接这家,明天出了新的再对接另一家。对接完一定会发现问题。客户反馈里提炼出一个共性诉求:应该有人帮他们把底层全部做好,让他们更专注于业务创新和上层应用。

如何识别用户需求、找到能解决需求的模型、修补模型天然的缺陷,再把最终的服务交付给用户——这正是音视频PaaS云服务厂商必须啃下的挑战。

腾讯云给出的答案是:多模态领域的Harness(驾驭工程)。

Harness关注的不是模型怎么生成,而是从生成到稳定交付给用户之间的整条产业链路——预处理、质检、拼接、转码、分发、格式适配。李郁韬打了个比方:这就像vibe coding,不是从零写代码,而是让模型和工具协同工作。

二、Harness为什么不会被模型“卷”掉?

一个绕不开的问题:大模型越来越强,Harness这种中间层会不会被压缩甚至绕过?

李郁韬的判断很笃定:不会,甚至Harness的重要性还会加强。

他给出了三个产业判断:

第一,客户需求没变。 过去十年腾讯云做音视频PaaS的基本定位,就是帮客户把底层做好,让他们专注业务创新。到了AI大模型时代,这个诉求没变,只是底层技术变了。客户不想自己对接各家模型、做prompt engineering、修bad case,他们要的是开箱即用的工程能力。

第二,生产力刺激需求,需求永远跑得更快。 大模型作为后端生产力,会显著刺激前端应用需求的增长,而且需求增长的广度会一直强于生产力的提升。这意味着一个结构性矛盾:大模型永远满足不了最终用户的极致需求,中间始终存在一个“供给关系差”。这正是Harness存在的必要性。

第三,模型格局会百花齐放。 三年前大家认为海外模型最强,但现在中国模型在质量上跟海外知名模型差距已经不大。多模态生成格局一到两年后会像语言模型一样百花齐放。客户追求的不是最极致的效果,而是最高性价比。

三、WAND:把Harness落地成产品

2026年6月5日,腾讯云音视频发布了AI品牌Tencent Cloud WAND,构建了6大自研媒体专用模型与60余项AI能力,覆盖内容生成、理解、处理、编码全链路。

WAND专门为电商、短漫剧、教育、赛事直播等垂直场景训练。李郁韬说,团队会把所有模型串起来——不只大语言模型,也包括多模态模型,甚至小参数量的画质提升模型和应用模型。他们去年就已经开始做多模态领域的Harness,恰好今年生成式视频模型变多,行业内外对Harness的理解也愈发趋同。

在具体能力上,WAND已经攻克了一个行业普遍未解的痛点:横版视频转竖版时,如何把比分牌、字幕、logo等元素合理地放进竖版画面。依托元素提取、字幕提取等技术,腾讯云已做到行业最优。

四、三个场景验证了Harness的价值

Harness的必要性,被三个落地场景反复验证。

世界杯直播是最直观的证明。画质增强、智能导播、自动剪辑、智能横转竖、质检溯源——AI全自动完成。国内端到端直播延迟低于800毫秒,全面实现4K超高清画质。腾讯云已连续三届支撑世界杯直播,从2018年“一周搭方案救场”,到2026年支撑17个国家地区,角色已彻底转变。

AI短剧是目前多模态应用最成熟的场景之一。国内头部漫剧客户中,近90%已选择腾讯云。原因不是某一项技术最强,而是Harness工程的效率和成本。多模态模型生成的视频普遍存在乱码、语音不连贯等问题,腾讯云的做法是分段修复——出现乱码在开头阶段修复,不需要重新生成整段,修复成本大幅降低。

翻译场景同样说明问题。行业常见的做法是多模态翻译后直接输出结果,稳定性差、容易出现幻觉。腾讯云的Harness工程做了一个闭环:运行、规划、检查、修复。

五、最大的机会:很多音视频场景值得重做一遍

在李郁韬看来,腾讯云卡位多模态Harness有两大机会。

第一,很多音视频场景的体验都值得重新做一遍。直播、点播、媒体创作、多媒体互动——每个场景在AI加持下都有重构的可能。

第二,未来会有更多、更强、更全面的模型出来,怎么快速把这些模型应用到企业级生产服务里,让最终用户感受到最新的大模型体验——这正是多模态Harness的核心价值。

视频生成已被业内视为继AI Coding之后,第二个跑通商业闭环的AI变现场景。今年以来音视频大模型赛道竞争骤然加速,字节Seedance、快手可灵AI形成“双寡头”格局。海外市场,OpenAI今年3月已宣布停止Sora的独立App和API接口,退出消费级AI视频生成市场。

在国内AI视频生成加速商业化的背景下,腾讯云选择了一条差异化的路——不做模型,做Harness。不争抢“最强模型”的标签,而是卡位“从模型生成到稳定交付”的整条链路。

正如李郁韬所说,Harness这个生态位的价值不在于取代模型,而在于让模型的能力真正变成用户可以稳定使用的服务。世界杯直播只是第一个验证场。接下来,短剧、电商、教育、具身智能——每一个音视频场景,都可能成为Harness的下一个战场。