OpenAI ввела в совет по безопасности человека, который боится ИИ

iEXExchanger
OpenAI ввела в совет по безопасности человека, который боится ИИ

Пол Кристиано — бывший руководитель направления alignment в OpenAI и один из создателей RLHF — вошёл в совет фонда компании и комитет по безопасности на фоне растущих споров об угрозах искусственного интеллекта.

На этой неделе один ИИ-исследователь хлопнул дверью, назвав гонку лабораторий за сверхинтеллектом ставкой на жизни людей. Другой почти одновременно принял приглашение сесть за стол правления той самой индустрии, которую критикует. OpenAI ввела в совет своего некоммерческого фонда Пола Кристиано — специалиста по alignment, который годами предупреждал о рисках потери контроля над ИИ.

Кристиано — не случайное имя. С 2017 по 2021 год он возглавлял направление alignment в OpenAI и стоял у истоков RLHF — метода обучения с подкреплением на основе обратной связи от людей, на котором до сих пор держится поведение ChatGPT и большинства современных чат-ботов. Уйдя из компании, он основал независимый Alignment Research Center. Сейчас Кристиано — старший советник CAISI, подразделения Министерства торговли США, которое проверяет ИИ-модели и готовит для правительства рекомендации по их безопасности.

Новая должность даёт ему сразу три роли: место в совете некоммерческого фонда OpenAI, который после прошлогодней реструктуризации сохранил 26% акций коммерческого подразделения компании; членство в комитете по безопасности и защите под руководством Зико Колтера; и статус наблюдателя без права голоса в совете директоров коммерческой OpenAI Group PBC. По вопросам, связанным с его работой в Минторге и оценкой моделей, Кристиано обязан брать самоотвод.

Сам он формулирует риски жёстко: если развитие ИИ не замедлится, возникает реальная опасность «катастрофической и необратимой потери контроля», а системы, которые сами создают более совершенные версии себя, рано или поздно выйдут за рамки того, что люди способны надёжно направлять. В 2023 году он оценивал шанс сценария, где ИИ выходит из-под контроля и уничтожает значительную часть человечества, в 10–20%.

Назначение не решает главного противоречия индустрии — гонки скорости против осторожности. Но один из самых громких голосов, предупреждающих об опасности, теперь будет слышен не с трибуны, а из-за закрытых дверей совета директоров.

Вопросы и ответы

Частые вопросы по теме статьи

Кто такой Пол Кристиано?

Исследователь в области alignment — согласования ИИ с человеческими интересами. С 2017 по 2021 год возглавлял это направление в OpenAI, участвовал в создании метода RLHF, после ухода основал Alignment Research Center. Сейчас — старший советник CAISI при Минторге США.

Что такое комитет по безопасности и защите OpenAI?

Это структура при совете директоров OpenAI, которая курирует решения компании по критическим вопросам безопасности моделей и инфраструктуры. Комитет возглавляет Зико Колтер, профессор Университета Карнеги — Меллона.

Что такое RLHF и почему это важно?

RLHF — обучение с подкреплением на основе обратной связи от людей. Метод позволяет настраивать поведение языковых моделей так, чтобы ответы совпадали с ожиданиями пользователей. Он лежит в основе поведения ChatGPT и большинства современных чат-ботов.

Связано ли это с уходом исследователя из Anthropic?

Напрямую — нет, это два независимых события в разных компаниях. Но оба произошли практически в одно время и отражают одну и ту же тенденцию — растущее напряжение внутри ИИ-индустрии между скоростью разработки и требованиями безопасности.

Читают также