多轮对话中的Token浪费,一直是AI应用开发者的隐形出血点。OpenRouter近日推出的一项新技术,正在把这个出血口堵上——通过智能缓存与复用机制,将多轮Agent调用的成本最高压缩至原来的1.75分之一。

Token的“重复浪费”困局

在AI Agent的实际工作流中,多轮调用是常态。一个智能体执行任务时,往往需要多次调用大模型:先理解用户意图,再规划步骤,再调用工具,最后总结输出。每一轮调用,系统都需要把大量上下文(系统提示词、历史对话、工具定义等)重新传给模型。

这些上下文Token在每一轮中几乎完全重复,但每次调用都要全额计费。对于长上下文场景,重复传输的Token量可能占整体消耗的60%以上。开发者花着买整只鸡的钱,却只吃到了鸡腿——大部分成本浪费在了重复传输上。

“缓存复用”如何把成本砍到1.75倍?

OpenRouter此次推出的新技术,核心机制是对多轮调用中的重复上下文进行智能识别与缓存复用。

当系统检测到后续调用与之前调用共享大量相同上下文时(例如相同的系统提示词、相同的工具定义、相同的对话历史前缀),会自动将这部分内容缓存,后续调用仅需传输增量部分。

首轮调用:正常计费,建立缓存

后续调用:仅对新增Token计费,缓存部分不计费

这意味着一个原本需要5轮调用、每轮消耗5000 Token的任务,总消耗从25000 Token降至约10000-15000 Token,成本直接砍掉40%-60%。

OpenRouter官方将此技术定位为“Agent工作流的默认优化层”——开发者无需修改任何代码,平台自动在底层完成缓存的识别、存储与复用。

实测数据:成本削减效果显著

根据OpenRouter披露的内部测试数据,在典型的多轮Agent场景中:

客服类Agent(5-8轮对话) :成本降低约40%-50%

编程辅助Agent(3-5轮代码生成+调试) :成本降低约45%-55%

数据分析Agent(多轮查询与可视化) :成本降低约35%-45%

极限场景(10轮以上长对话) :成本降低最高可达60%以上,即“砍到1.75倍”的表述来源

对于日均调用量百万级的中大型AI应用,这意味着每月数万乃至数十万美元的成本节约。

行业意义:让Agent从“奢侈品”变成“日用品”

多轮Agent调用成本过高,一直是阻碍AI Agent大规模商用的核心瓶颈之一。许多开发者被迫在“减少轮次(牺牲效果)”和“控制调用量(限制用户)”之间做选择。

OpenRouter这项技术的价值,不在于某个算法突破,而在于它让“让Agent多跑几轮”这件事变得不再昂贵。当多轮调用的边际成本被大幅压缩,开发者可以更自由地设计复杂的Agent工作流——让智能体多思考几步、多验证几次、多调用几个工具,而不必时刻盯着Token计数器心疼。

结语

大模型推理成本的下降,从来不只是靠模型本身降价。OpenRouter用“缓存复用”四个字,给行业上了一课:优化调用效率,和优化模型参数同样重要。当每一轮对话的重复Token不再被重复计费,AI Agent才真正有可能从“演示级”走向“生产级”。