OpenAI安全委员会迎来“惧怕AI”的专家

iEXExchanger
OpenAI安全委员会迎来“惧怕AI”的专家

OpenAI对齐研究前负责人、RLHF共同开发者保罗·克里斯蒂亚诺,加入公司非营利基金会董事会及安全与安保委员会,正值业界对AI风险担忧加剧之际。

本周,一位人工智能研究员愤然辞职,称超级智能竞赛是拿人类生命做的鲁莽赌注。几乎与此同时,另一位持类似担忧的专家却接受了这个行业递来的席位:OpenAI宣布,长期从事对齐研究的保罗·克里斯蒂亚诺加入其非营利基金会董事会。

克里斯蒂亚诺并非无名之辈。2017年至2021年,他在OpenAI领导对齐研究团队,并参与开发了RLHF——基于人类反馈的强化学习方法,至今仍是ChatGPT及大多数聊天机器人行为的基础。离职后,他创立了独立的对齐研究中心(ARC)。如今他是美国商务部下属机构CAISI的高级技术顾问,负责评估人工智能模型并为政府起草安全指南。

这一新职务让他同时身兼三职:进入非营利基金会董事会——该基金会在去年重组后仍保留营利性主体OpenAI Group PBC百分之二十六的股份;加入由济科·科尔特领导的安全与安保委员会;并在营利性公司董事会担任无表决权的观察员。凡涉及他在商务部的工作或模型评估的事项,他都需要回避。

克里斯蒂亚诺的措辞毫不含糊:如果人工智能的发展不放慢脚步,行业将面临“灾难性且不可逆转的失控”风险,而那些被设计用来创造更强继任者的系统,终将超出人类可靠驾驭的能力范围。早在2023年,他就估计人工智能失控并导致人类大部分死亡的概率为10%到20%。

这项任命并未化解行业在速度与谨慎之间的核心矛盾。但一个最响亮的风险警示者,如今不再只是场外呐喊,而是坐进了董事会内部。

问答

本文相关常见问题

保罗·克里斯蒂亚诺是谁?

一位对齐研究员,2017年至2021年在OpenAI领导该方向的研究,并参与开发了RLHF方法。离职后创立了独立的对齐研究中心。目前他是美国商务部下属机构CAISI的高级技术顾问。

OpenAI的安全与安保委员会是什么?

这是董事会层面的机构,负责监督公司在模型与基础设施关键安全问题上的决策,由卡内基梅隆大学教授济科·科尔特担任主席。

什么是RLHF,为何重要?

基于人类反馈的强化学习是一种训练方法,用于调整语言模型的回答方式,使其符合人们的期望。它是ChatGPT及大多数现代聊天机器人行为的基础。

这与Anthropic研究员辞职有关吗?

并无直接关联,这是两家不同公司发生的独立事件。但两者几乎同时发生,反映出同一趋势:AI行业在开发速度与安全要求之间的紧张关系正在加剧。