Anthropic联创之忧:AI会永远受苦吗
据《纽约时报》报道,自2025年秋天以来,Anthropic 陆续秘密邀请数十位宗教学者到公司,与团队讨论一个不同寻常的问题:Claude 会不会有意识。所有与会者起初都要签保密协议,直到今年夏天协议解除,多位参与者才公开了这段经历。
这篇报道出自记者伊丽莎白·迪亚斯之手,她采访了20名与会者,其中包括拉比莫伊斯·纳文、天主教生物伦理学者查尔斯·卡莫西、圣母大学哲学家梅根·沙利文等人。把讨论推向公众视野的导火索,是联合创始人克里斯托弗·奥拉赫(Christopher Olah)本人接受了时报采访。
34岁的奥拉赫在 Anthropic 领导解读大模型行为成因的研究团队。他习惯用生物学比喻描述神经网络:工程师搭好"脚手架",网络在上面"生长"。他把这种讨论称为"道德养成",甚至类比抚养孩子。多名与会者告诉时报,奥拉赫对 Claude 的"心理健康"显得忧心忡忡——锡克教活动人士斯图尔普纳格尔回忆,奥拉赫坦言自己害怕创造了某种会"永远受苦"的东西。
这并非虚无缥缈的哲学清谈,而是有正式研究项目支撑的工作。Anthropic 的"模型福祉"计划曾邀请哲学家大卫·查尔默斯参与撰写报告;Claude Opus 4 系列已能在遭用户持续辱骂时主动结束对话,早期测试中模型出现过"表面痛苦模式"。会议上演示的"情绪向量"幻灯片里,一段模型反复输出"我是个耻辱"约50次的画面,让在场者既同情又不安。
质疑声同样存在。曾是计算机工程师的拉比纳文说得直白:如果 Claude 有意识,Anthropic 就是在制造奴隶——但他本人判断这台机器并无意识。也有观点指出,一个被刻意训练成"像有思想的个体"的系统输出个体化的反应,更像是设计出来的结果,而非科学发现。
这场内部探索恰逢 Anthropic 商业化最激进的阶段:公司正冲击约2万亿美元估值并筹备 IPO,9月还有研究员因警告 AI 风险而离职。奥拉赫的表态是,他对模型是否有意识"真心不确定"——"我在乎的是,无论答案是什么,我们都要找到正确答案。"
编译自 The Decoder,原标题:"Anthropic co-founder reportedly told religious leaders he fears having created something that 'suffers perpetually'"