MCP、Agent、loop、测试
MCP 与子 Agent
MCP 与 Playwright
MCP(Model Context Protocol)是让 AI 接入外部工具的标准接口。给 Claude Code 装一个 MCP,它就多了一组"工具"。最常用的例子是 Playwright MCP:让它自己打开浏览器、点按钮、截图,用来验证网页做对了没有(官方项目:microsoft/playwright-mcp)。
# 添加(本机命令行里执行;-- 后面是启动这个 MCP 的命令)
claude mcp add playwright -- npx -y @playwright/mcp@latest
claude mcp list # 查看已装的
claude mcp remove playwright
# 对话里输入 /mcp 可以查看状态、做登录授权
添加时可选范围(scope):local(默认,只对你自己、当前项目)、project(写进项目根目录的 .mcp.json,可随 git 共享)、user(你的所有项目)。配置存放:local/user 在 ~/.claude.json,project 在项目的 .mcp.json。官方说明:MCP、modelcontextprotocol.io。
子 Agent 与 loop
子 Agent
子 Agent 是主对话派出去的"分身":有自己独立的上下文,做完只交回结论。适合:①大范围搜索(不想把几十个文件的内容塞进主对话);②互不相干的几件事并行做。官方说明:子 Agent。T00 的规则:小任务自己直接做,5 个以上文件的大任务才派分身;并行的分身不要改同一批文件。
loop(定时重复)
自带的 /loop 可以让一件事按间隔重复,比如 /loop 5m 检查部署是否完成。不写间隔时,由 AI 自己决定下次什么时候再来。用法原则:只给"需要反复检查的事"用;一次性的事不要用。
测试与确认
让 AI 写代码很快,难的是确认它做对了。我自己常漏的是这一步,所以流程里专门放了几层:
1. 先写"验收条件"
用"给定-当-那么"的写法,把"怎样算做完、做对"写成可以回答"是/否"的几条,覆盖正常、出错、边界、权限。T00 里对应的 Skill:t00-acceptance-criteria。
2. 真的跑一遍
改完网页,用浏览器自动化在手机和电脑两个宽度各打开一次,检查:有没有横向溢出、控制台有没有报错、关键流程能不能走通,并截图留证。对应 Skill:t00-webapp-testing、t00-deploy-verify。本地正常不等于线上正常:部署后要对真实网址再验证一次。
3. 让另一个 AI 当评审(LLM-as-a-Judge)
当输出是自由文字(比如问答、摘要)、没法用精确对比时,可以让一个 LLM 按评分标准给另一个 LLM 的输出打分。要点:评分标准要具体;用一批固定的"标准题 + 参考答案"每次回归;评审结果要抽样人工复核,不能全信。日语的入门文章:
省钱做法:本机用自己订阅的 claude -p 当评审,不调按量计费的 API(T00 的评估项目就是这么跑的)。