MCP、Agent、loop、测试

MCP 与子 Agent

1AI2MCP外接工具3浏览器 / 数据库/ 文件…4子 Agent分身并行

MCP 与 Playwright

MCP(Model Context Protocol)是让 AI 接入外部工具的标准接口。给 Claude Code 装一个 MCP,它就多了一组"工具"。最常用的例子是 Playwright MCP:让它自己打开浏览器、点按钮、截图,用来验证网页做对了没有(官方项目:microsoft/playwright-mcp)。

# 添加(本机命令行里执行;-- 后面是启动这个 MCP 的命令)
claude mcp add playwright -- npx -y @playwright/mcp@latest

claude mcp list            # 查看已装的
claude mcp remove playwright
# 对话里输入 /mcp 可以查看状态、做登录授权

添加时可选范围(scope):local(默认,只对你自己、当前项目)、project(写进项目根目录的 .mcp.json,可随 git 共享)、user(你的所有项目)。配置存放:local/user 在 ~/.claude.json,project 在项目的 .mcp.json。官方说明:MCP、modelcontextprotocol.io。

如实说明:装 MCP 前先看清它能做什么。能操作你电脑浏览器、能读文件的 MCP 权限很大,只装来源可靠的,装好后在权限里留意哪些工具被你放行了。

子 Agent 与 loop

子 Agent

子 Agent 是主对话派出去的"分身":有自己独立的上下文,做完只交回结论。适合:①大范围搜索(不想把几十个文件的内容塞进主对话);②互不相干的几件事并行做。官方说明:子 Agent。T00 的规则:小任务自己直接做,5 个以上文件的大任务才派分身;并行的分身不要改同一批文件。

loop(定时重复)

自带的 /loop 可以让一件事按间隔重复,比如 /loop 5m 检查部署是否完成。不写间隔时,由 AI 自己决定下次什么时候再来。用法原则:只给"需要反复检查的事"用;一次性的事不要用。

测试与确认

让 AI 写代码很快,难的是确认它做对了。我自己常漏的是这一步,所以流程里专门放了几层:

1. 先写"验收条件"

用"给定-当-那么"的写法,把"怎样算做完、做对"写成可以回答"是/否"的几条,覆盖正常、出错、边界、权限。T00 里对应的 Skill:t00-acceptance-criteria。

2. 真的跑一遍

改完网页,用浏览器自动化在手机和电脑两个宽度各打开一次,检查:有没有横向溢出、控制台有没有报错、关键流程能不能走通,并截图留证。对应 Skill:t00-webapp-testing、t00-deploy-verify。本地正常不等于线上正常:部署后要对真实网址再验证一次。

3. 让另一个 AI 当评审(LLM-as-a-Judge)

当输出是自由文字(比如问答、摘要)、没法用精确对比时,可以让一个 LLM 按评分标准给另一个 LLM 的输出打分。要点:评分标准要具体;用一批固定的"标准题 + 参考答案"每次回归;评审结果要抽样人工复核,不能全信。日语的入门文章:

省钱做法:本机用自己订阅的 claude -p 当评审,不调按量计费的 API(T00 的评估项目就是这么跑的)。

如实说明:评审模型会偏向自己风格的答案、也会被长答案"哄"高分。它是"便宜的初筛",不是最终裁判。