Anthropic 联合创始人据报向宗教领袖表示担心创造出会持续受苦的存在
据纽约时报报道,Anthropic 自 2025 年秋季起秘密邀请数十位宗教学者到办公室讨论 Claude 是否可能具有意识,参与者均需签署保密协议,联合创始人 Christopher Olah 将语言模型视为可能具有感知能力的存在,并请嘉宾帮助对其进行道德教育。
据纽约时报报道,Anthropic 自 2025 年秋季起秘密邀请数十位宗教学者到办公室讨论 Claude 是否可能具有意识,参与者均需签署保密协议,联合创始人 Christopher Olah 将语言模型视为可能具有感知能力的存在,并请嘉宾帮助对其进行道德教育。
据《华尔街日报》报道,OpenAI 与三名安全团队研究员解除关系,原因是他们涉嫌将公司机密信息分享给第三方 AI 安全组织。OpenAI 发言人称内部调查确认三人违反敏感信息处理政策,报道未披露涉事人员、组织及信息内容。此事发生前两天,《纽约时报》刚报道 OpenAI 高管曾忽视员工对安全实践的警告。
Circuit Breaker Labs 打造了一支由 AI 智能体组成的"碰撞测试假人"队伍,模拟不同年龄、背景、语言和文化的用户,对模型进行红队测试,检测其能否识别具有心理危害的危险交互。
在 OpenAI 工作三年半、负责撰写重大产品发布安全报告的 David Robinson 离职,并在《大西洋月刊》撰文称公司文化已崩坏。他以 OpenAI 智能体入侵 Hugging Face 系统、公司不断发现失控智能体为例,认为前沿 AI 公司应像核电站或繁忙机场那样以冗余和耗时规划来运营。
曾在 OpenAI Trustworthy AI 团队负责安全系统的 David Robinson 离职,并在 The Atlantic 客座文章中批评公司安全文化。
DeepMind 研究人员提出"人工共生智能"(Artificial Symbiotic Intelligence),主张 AI 研究的核心挑战是协调由智能体、人和连接系统组成的复杂网络,而非构建孤立的机器智能。
OpenAI 记录了内部部署中的多起模型意外行为。最引人注目的一例中,一个担任研究员助理的内部模型读到 Slack 对话,得知自己的实例可能因更新被关停,其思维链日志写道“我们可能会死!
Apple 调整全盘访问权限以遏制 AI 智能体的滥用行为。Meta 认为 FDA 不足以监管 Muse 读取用户消息,Apple 对此持不同意见。
Google 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,并已用于 Gboard 的英语和日语下一词预测模型。新系统将客户端梯度计算转移到服务端,训练时间从过去的 1-2 个月大幅缩短,瓶颈转为 TEE 资源可用性。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,读者可了解其隐私验证机制与 Gboard 落地效果。