7月27日,美团全场景AI Agent平台CatPaw正式上线。该平台搭载了本月刚刚开源的1.6T总参数开源大模型LongCat 2.0,标志着美团自研万亿参数大模型从技术开源全面迈向产业落地。

LongCat 2.0:首个五万张国产算力卡训出的万亿模型

LongCat 2.0是业界首个在五万张国产算力卡上完成全流程训练与推理的万亿参数大模型。模型采用MoE架构,总参数规模1.6万亿,平均激活约480亿参数,动态范围33B至56B。原生支持100万Token超长上下文,可一次处理百万字级输入。

6392075664516440403087591.jpg

架构上,LongCat 2.0创新性地引入了LongCat稀疏注意力机制和N-gram Embedding。LongCat稀疏注意力通过流感知索引、跨层索引等策略,将长文本计算量从平方级降至线性级,在100万Token的超长上下文中依然保持精准的信息定位与理解能力。模型还首创了零计算专家机制,实现Token级动态计算预算——复杂Token激活更多专家,简单Token节省算力。

性能方面,LongCat 2.0在多项评测中表现突出。SWE-bench Pro得分59.5,超越Gemini 3.1 Pro与Claude Opus 4.6;SWE-bench Multilingual得分77.3,Terminal-Bench 2.1达70.8;搜索智能体评测RWSearch得分78.8,生产力场景评测FORTE得分73.2,BrowseComp得分79.9。在真实Agent场景中,其预览版已在Hermes月调用量位列全球第一、Claude Code月调用量位列全球第二。社区反馈显示,在工具调用、复杂指令执行等Agent核心能力方面,LongCat 2.0接近Claude Opus 4.6水平。

在国产算力适配方面,LongCat团队自2023年起从千卡起步,逐步攻克算子适配、通信优化、分布式稳定性等基础难题。通过卡间通信异常处理、弹性扩缩卡和自动故障恢复,将月均故障率降低70%以上;通过流水线调度、显存优化和算子级控核,训练MFU提升1.5倍,实现稳态日吞吐超过1T tokens/day。

CatPaw:开箱即用的全场景AI智能工作台

CatPaw提供开箱即用的全场景AI智能工作台与企业级Agent开发托管能力。平台深度融合了美团在本地生活领域的全链路行业认知,针对门店经营、评价诊断、营销转化及履约配送等场景,封装了即装即用的专家与技能。

CatPaw具备多项核心能力:

三端协同:支持移动端、PC端与云端无缝协作。移动端可随时发起任务与查看进度,PC端专注本地深度执行(文件操作、浏览器控制、终端命令),云端支持7×24小时不间断运行。

多Agent并发处理:面对跨领域复杂任务,系统自动进行任务拆解,调度多个具备专属工具的Agent并发处理,各Agent在独立环境中互不干扰,进度实时可见,结果自动汇总。

跨会话长期记忆:自动记忆用户的个性化偏好、操作习惯与历史上下文,跨设备、跨对话保持连续理解。

技能沉淀与复用:内嵌浏览器支持操作过程一键录制,将日常高频流程自动生成专属技能,让个人与团队经验沉淀为可复用的数字化资产。

安全合规:Agent运行环境严格隔离,租户间数据互不可见;凭证集中托管,Agent全程零接触敏感资产;支持分级权限管控与私有化部署。

内部大规模落地:9万员工、3万个Agent

CatPaw已在美团内部完成大规模验证:累计覆盖9万名员工,搭建Agent超3万个。内部研发渗透率超过95%,增量代码AI生成率逾50%。平台已在餐饮、美业、宠物医院等多个真实业务场景中完成验证。

在商家侧,CatPaw定位于辅助经营的“搭档”,可自动完成数据汇总、异常识别、策略输出等重复性工作。价格调整、活动发布等关键决策仍由经营者确认。目前平台已向合作商家开放体验。

从LongCat 2.0开源到CatPaw全面上线,美团贯通了“自研大模型至全场景AI应用”的完整演进路径,为大模型从“跑得动”向“用得好”的范式转移提供了一个具备规模化落地价值的行业参考。