К содержанию
Новости

Amanda Askell работает над тем, чтобы Claude принимал этически взвешенные решения

Amanda Askell работает над тем, чтобы Claude принимал этически взвешенные решения

По мере того как системы ИИ выходят за пределы формата диалоговых ассистентов и превращаются в более «агентные» инструменты, способные самостоятельно выполнять задачи, им всё чаще приходится принимать решения с реальными последствиями. Вопрос о том, будут ли такие системы учитывать моральную сторону своих действий, изучает Amanda Askell.

Askell получила степень PhD по философии в New York University. Затем два года работала в OpenAI, а в 2021 году присоединилась к Anthropic. Там она участвует в работе над тем, чтобы у модели Claude сформировался своего рода «инстинкт» этичного поведения. По мере роста возможностей системы задача усложняется. Как объясняет Askell, чем автономнее становятся модели и чем на более длинный горизонт действий они рассчитаны, тем больше возникает точек, где им приходится принимать решения, и тем важнее продумывать такие ситуации заранее.

Askell обращает внимание на разницу между обсуждением гипотетической моральной дилеммы и реальными решениями от имени пользователя. Одно дело, попросить языковую модель рассуждать о том, этично ли покупать акции оборонной компании. Совсем другое, поручить ей управлять инвестиционным портфелем пользователя без ежедневного участия человека. Во втором случае появляется более сложный вопрос: как ИИ должен принимать решения, связанные с ценностями, когда действует от имени конкретного человека.

По словам Askell, один из подходов состоит в том, чтобы учить Claude внимательно реагировать на пользователя и улавливать его ценности, не навязывая собственную «idiosyncratic ethics». Идея в том, чтобы решения системы отражали предпочтения пользователя, а не внутренние установки самой модели.

Ключевые факты

  • Аманда Аскелл, PhD по философии из New York University.

  • До перехода в Anthropic она провела два года в OpenAI.

  • Аскелл присоединилась к Anthropic в 2021 году и работает над тем, чтобы внедрить в модель Claude механизмы принятия этических решений.

  • В Anthropic её работа связана с задачей научить Claude учитывать ценности пользователя при принятии решений без навязывания собственной «идiosyncratic ethics» модели.