AI 已经能检索、起草、改代码和操作网页。“它能不能做”因此不再是足够好的委托标准。
更稳妥的问题有三个:错误能否撤回,结果能否独立复核,动作是否已经对别人产生后果。三问里任何一项不清楚,就不能把最终确认一起交出去。
本文讨论个人写作、研究和产品工作的责任边界,不提供法律或合规意见。
委托矩阵
| 动作 | AI 可以承担 | 人必须保留 |
|---|---|---|
| 搜集候选材料 | 扩大检索、整理线索 | 确认来源真实且足以支持主张 |
| 起草与分析 | 生成草稿、比较选项 | 定义问题、选择取舍、检查遗漏 |
| 可回滚修改 | 在副本或测试环境执行 | 查看差异、运行验证、决定是否采用 |
| 对外发布与发送 | 准备内容和操作步骤 | 确认收件人、范围、时机与最终内容 |
| 付款、删改账号或生产数据 | 不自主执行 | 由有权限且承担后果的人明确批准 |
这个矩阵不按工具名称变化。新模型能力提高时,可委托的执行可能增加,但证据责任和外部后果不会因此消失。
NIST AI RMF 把治理、使用情境、测量和管理放在同一风险流程中;生成式 AI 补充文件进一步要求检查来源与引用,并提示自动化偏见和检索数据中的提示注入风险。这两份文件支持“先定义情境和容忍度,再委托执行”,不替某个个人任务给出固定边界。
证据与后果的双重确认
一次 AI 工作流至少需要两个不同的确认点。
第一个在结论进入成稿之前:链接能否打开,原文是否真的支持这句话,样本限制是否被保留。这里确认的是证据,不是语言是否流畅。
第二个在动作产生外部后果之前:发布给谁、发送什么、是否付款、是否改变账号或生产状态。OpenAI 对 ChatGPT agent 的公开说明也区分网页操作与具有后果的动作,并描述关键操作的确认与监督。
“人工在环”也不能只是一句口号。确认人需要看得到输入、已执行动作、差异和失败状态;如果只能在最后看到一份流畅结果,就没有真正复核中间边界。
2 周对照
感觉更快不代表完整交付更快。METR 对经验丰富的开源开发者做过随机试验;在该样本、任务和当时工具条件下,允许使用 AI 的任务平均完成时间反而更长。这个结果不能推广到所有工作,但足以说明效率需要包含审阅、纠错和维护后实测。
可以选一条已经在用的工作流,连续记录 2 周:
- 从接受任务到可交付结果的总时间;
- AI 运行、人工检查、返工和恢复分别用了多久;
- 哪些错误由人发现,哪些错误直到下游才暴露;
- 每次对外动作是否真的经过预定确认点;
- 不使用 AI 时的同类任务基线。
只有总时间下降、错误仍可发现、确认点没有被绕过,才扩大委托范围。效率没有改善时,缩回到起草或候选建议;错误难以发现或动作不可撤回时,保留人工执行。