写代码这件事,AI已经替你干了。可验收这件事,还压在你身上。代码到底写没写对,AI不负责,最后还得你自己一行行看过去——这道坎,卡住了许多人。

最近,Anthropic把AI验收也做进了循环。Claude写完代码之后不直接交差,而是自己接着跑四道检查。四道跑完,才算交付。

一、验证循环:从“会写代码”到“会检查自己写的代码”

7月22日,Claude Code团队公开了内部每天都在用的“验证循环”(verification loop)。官方定义很简单:它是一个Claude检查并尝试修复自己工作的迭代过程。

它改动的,是智能体干活的闭环。以前是“收集上下文→执行动作→人工检查”,最后那一步卡在人身上。现在变成了“收集上下文→执行动作→自动验证→修复→再验证”——检查和修复被塞回了循环里面。

有些检查Claude本来就会做。代码库里那些确定性的信号——type checker、linter、跑测试、运行时报错——它读得懂,也会顺手改掉。真正麻烦的是另一类:界面改得对不对、用户流程顺不顺、这次改动有没有埋下看不见的坑。这些过去只能靠人盯着,同样的检查做上几十上百次。

Anthropic的解法,是把你每次都要手动做一遍的那些检查,一条条写下来,封装成Skill,交给Claude在每次任务里自动执行。

二、Claude Code团队每天都在用的4个自查Skill

Claude Code团队内部,每天都在用这四个自查的Skill。

/code-review:揪出潜在的bug

专审代码改动,把潜在的bug揪出来,顺带给一份review意见。等于给自己配了个不知疲倦的审稿人。

/simplify:清理冗余实现

清理本次改动的diff,把绕来绕去的复杂实现删掉,让结构变简单。不加功能,只做减法,把日后的维护成本压下来。多数人写代码都是往上堆,能主动做减法的工具,尤为难得。

/verify:端到端验证

真刀真枪跑一遍,确认功能是真的完成了,而非“看起来完成了”。在CLAUDE.md里写清构建和测试命令,它就照着执行。

/design:视觉核对

只在动了UI时上场,对着仓库里的DESIGN.md,逐条核对视觉实现有没有跑偏。

这4个Skill的底层,Claude Code已经铺了一层现成的验证支持:内置的/verify能把应用跑起来观察变化,还有专门在PR上做多智能体审查的Code Review、能在每次提交时自动触发的GitHub Actions。团队那4个Skill,等于在这层通用地基上又加了一道自己的工序。

三、怎么写一个自己的验证Skill?

Anthropic的思路是:把你每次都要手动做的那一步写下来,就像给第一天入职的新同事交代注意事项。

第一步:把手动检查翻译成大白话。 如果你连这步检查该怎么描述都卡壳,先让Claude给一版通用最佳实践,再在上面改。你的版本跟通用做法不一样的那几点,恰恰是最该记下来的。

第二步:把模糊判断写成硬规则。 检查不能停留在“感觉对不对”这种模糊判断。典型项目专属红线——“任何删掉数据库字段、却没配套数据迁移步骤的改动,一律打回”。这是通用linter永远抓不到、却是你项目专属的“土规矩”。凡是你一直靠手动死盯才守得住的红线,都值得写成一个循环。

第三步:丢给skill-creator或直接落Markdown。 两种方式选一种:调用skill-creator,让它反过来采访你几句后自动生成;或者自己往.claude/skills/目录扔一个Markdown文件。

验证技能的触发方式也分四档:手动调用的“独立模式”、嵌入任务流程的“嵌入模式”、多个技能串联的“链式模式”,以及每次提交代码时自动运行的“PR门禁模式”。

四、瓶颈转移:从“写代码”到“验代码”

过去几十年,软件工程所有的流程——写需求、做规划、层层评审、开不完的会——本质上都是因为:写代码太慢,工程师的时间太值钱。可当AI把写代码这一环变快、变便宜,这个前提就不复存在了。

Claude Code团队自己的判断是:瓶颈没有消失,它只是转移了——从“写代码”转移到了验证、代码评审、安全这些环节。代码生成得太快,新的问题变成了这些代码到底对不对,谁来维护,人还跟不跟得上审代码的节奏。

验证循环的意义,正是在这个新瓶颈上开了一道口子。AI开始从“会写代码”进化到“会检查自己写的代码”——开发者不必再手动检查每一行代码,AI会通过反复验证与修复,直至代码完全符合要求。开发者得以从重复劳动中解放出来,聚焦于更具创造性的工作