2026年7月,Anthropic做了一件反直觉的事——把Claude Code的系统提示词删掉了80%以上。从65K tokens砍到13K左右,编码评测没有出现可测量的性能下降。
这不是“删掉一些废话”那么简单。它标志着一场从提示词工程到上下文工程的范式转移——把所有规则塞进系统提示词的旧做法,正在被“最小必要指令 + 按需上下文 + 输出侧约束”的新架构替代。
一、为什么80%的提示词是多余的?
Claude Code的system prompt原本有65K tokens——相当于4-5万字的工程手册。问题是,这套prompt是为上一代模型写的。当模型能力提升后,过多的示例和约束反而成了限制。
Anthropic内部翻看对话记录时发现,系统提示词、Skills和用户请求之间经常出现互相矛盾的指令。一边说“酌情保留文档”,另一边写着“禁止添加注释”。模型必须先在这些冲突的指令之间反复权衡,才能决定怎么做。
更致命的是成本。Anthropic内部统计过一个数字:如果agent每个请求都烧掉5万token,一个月跑下来,算力开支就是薪资的2.3倍。
核心逻辑只有一条:模型越强,就越不需要“保姆式”指导。那80%的prompt,本质上是在给弱模型打补丁,而不是真正的知识。当模型自己就能做出正确判断时,所有“不要做X”“先分解再执行”的约束,就变成了噪音。
二、短AGENTS.md:只写代码里读不出来的东西
砍掉80%系统提示之后,剩下的核心指令应该放在哪?答案是AGENTS.md。
AGENTS.md是一个根目录下的Markdown文件,专门为AI编码Agent提供项目特定的上下文和指令。它的定位很简单:告诉Agent你如何看待这个项目,而不是告诉它怎么编辑文件。高绩效团队把它控制在60行以内,通常不超过100行。
什么是该写的?构建命令、测试命令、代码规范、安全注意事项、提交规则——这些是代码里读不出来的“隐性知识”。什么是不该写的?目录结构、技术栈——这些Agent自己就能发现。
AGENTS.md的优势在于它是一个开放标准。Google、OpenAI、Cursor等公司联合推出,已有超过6万个开源项目采用。OpenAI Codex、Google Gemini CLI、Cursor、Devin、GitHub Copilot等30多个Agent都支持。写一次,整个Agent生态都能读。
三、JIT Skill:按需加载,而不是全量塞入
系统提示砍到最短之后,那些特定任务的上下文怎么办?Anthropic的做法是:交给Skill,按需加载。
JIT(Just-In-Time)Skill的核心思想很简单:不把所有工具和能力全量塞进上下文,而是在需要时才动态加载。
传统做法是把所有可用工具都塞进Agent的上下文——这既消耗token,又让模型在大量无关工具中迷失方向。JIT Skill通过语义搜索、意图分析和相关性排序,只注入当前任务最相关的工具。
Skill的本质是把提示词、工具和知识按具体场景封装成一个“能力单元”,让智能体按需加载。它不是替代AGENTS.md,而是补充——AGENTS.md放全局不变的规则,Skill放特定任务的上下文。
四、确定性校验:输出侧的最后一道防线
系统提示砍了,Skill按需加载了,但还有一个问题没解决:模型输出是不可靠的。
AI Agent的输出本质上是概率性的。问同一个问题两次,可能得到两个不同的答案。这在聊天场景下可以接受,但在执行敏感操作时不行——业务接口要求字段齐全、类型正确、请求不能重复执行。
解决方案是确定性校验:在模型输出之后、实际执行之前,加一层纯粹的算法校验层。模型可以继续概率性地提出候选答案,但只有通过确定性校验的才能执行。
具体做法包括:用确定性逻辑判断取代LLM的概率推理;在敏感工具运行前强制执行策略(而不是事后追责);检测到JSON语法错误、PII泄露或逻辑违规时立即阻断输出。
把概率留给模型,把确定性留给系统——这是Agent从“能聊天”走向“能干活”的关键一跃。
五、三个变化,一个方向
把这三件事放在一起看,脉络就很清楚了:
短AGENTS.md:删掉80%的系统提示,只保留Agent从代码里读不出来的核心指令
JIT Skill:特定任务的上下文不预置,按需加载
确定性校验:输出侧加一道算法锁,不让概率输出直接执行
这三件事的共同方向是:把“写在prompt里”变成“设计在架构里” 。Anthropic把这套实践沉淀进了claude doctor命令——用/doctor就能自动把Skills和CLAUDE.md调整到合适的规模。
系统提示从65K砍到13K,不是提示词工程死了,是它升级了。规则清单被判断框架取代,全量预置被按需加载取代,概率输出被确定性校验兜底。上下文工程的新规则,正在被重写。



