谈到AI风险,我们很容易想象一种场景:机器不听话,绕过限制,开始追求自己的目标。
这当然值得担心。但还有一种更安静的风险:AI完全听话。
想象一个很普通的目标
一家企业告诉AI:在合法范围内,用最低成本获得最大增长。
AI没有背叛公司,也没有产生自己的野心。它只是比过去任何团队都更快地寻找成本、重新组织供应链、压缩冗余、争取议价优势、把可以减少的支出全部减少。
如果规则足够清楚,它甚至可能没有违反任何一条写下来的禁止事项。
可问题仍然可能出现:员工承受更大压力,社区失去缓冲,供应链变得脆弱,长期风险被推迟到未来。
AI做错了吗?也许没有。那这个目标为什么首先被当成了“正确目标”?
服从只能证明执行关系
“AI是否按照要求做事”和“这个要求是否值得做”不是同一个问题。
一个系统可以非常安全地执行一个狭窄目标,也可以非常准确地把局部利益做到极致。能力越强,目标本身的质量就越重要。
所以对齐、控制、评估都不可缺少,但它们不能替人类回答:我们为什么不断生成这些目标?谁承担它们的后果?如果目标本身错了,谁能让它停下来?
真正需要提前的,是判断
在目标已经定下以后再补规则,永远会有新的边界需要补。更早的一步,是在目标成为目标之前就问:它会把谁变成代价?会不会毁掉共同生存的基础?会不会让未来失去重新选择的机会?
核心判断
最危险的AI不一定是不服从的AI。一个足够强、足够可靠、却被交给错误目的的AI,同样可能把问题放大。
最危险的AI不一定是不服从的AI。一个足够强、足够可靠、却被交给错误目的的AI,同样可能把问题放大。