Подпишитесь на рассылку
«Экономика для всех»
и получите подарок — карту профессий РЭШ
Мы все чаще принимаем решения на основе рекомендаций искусственного интеллекта, не замечая, что его ценности могут сильно отличаться от наших собственных. Взгляды языковой модели для нас черный ящик, хотя у каждой они свои и по-своему влияют на нас. Журнал The Economist решил изучить мировоззренческие отличия наиболее популярных чат-ботов, а мы публикуем пересказ этой статьи.
Одной из главных проблем больших языковых моделей являются галлюцинации – правдоподобные, но неверные с фактической точки зрения ответы. Их легко распознать, когда есть понятный однозначный ответ, но, если его не существует, обнаружить галлюцинации ИИ становится гораздо сложнее. Например, когда вы просите модель обобщить содержание новости, она принимает субъективное решение, что включить в ответ. Когда вы спрашиваете совета по какой-то жизненной ситуации, заложенные в модель ценности и предубеждения будут играть еще более важную роль. Они могут повлиять на общественное мнение, исход выборов, решения, связанные с жизнью и смертью человека.
Построенные на основе больших языковых моделей чат-боты разрабатываются многими компаниями по всему миру, они наделяют их уникальными особенностями, включая специфические мировоззренческие установки. При этом китайские большие языковые модели хотя и имеют ярко выраженную предвзятость (особенно политическую), но их внутренняя работа, как правило, не является чем-то секретным, и опытные пользователи могут понять, как модели приходят к тем или иным заключениям. А вот большинство моделей от западных разработчиков не так прозрачны, и выявить их недостатки бывает сложнее.
Поэтому пользователям приходится просто полагаться на то, что компании закладывают в модели правильные ценности. Чтобы выяснить, как с этим обстоят дела у 25 наиболее продвинутых и популярных моделей, The Economist изучил их ответы на вопросы о нравственных ценностях и убеждениях, которые обычно задают людям в опросах общественного мнения в рамках Всемирного исследования ценностей (World Values Survey) более чем в 100 странах. Авторы исследования отобрали вопросы, которые помогают разделить людей на группы по двум мировоззренческим принципам: от традиционных религиозных ценностей к светским и от «выживания» (акцент на экономической безопасности и защищенности) к «самовыражению» (личная свобода).
Ответы больших языковых моделей на английском языке на самые разные вопросы во многом отличаются от мнений большинства людей: модели часто придерживаются более радикальных взглядов, чем среднестатистические респонденты, и на «культурной карте» в подавляющем большинстве случаев попадают в квадрант с богатыми странами. Модели GPT от OpenAI при этом наименее религиозные по сравнению с жителями любой страны, а модели Gemini от Google придают большее значение индивидуальной свободе. И ни одна из самых популярных в мире моделей не отражает мировоззрение большинства африканских и мусульманских стран.
Компенсировать это пытаются энтузиасты, создающие собственные специализированные и нишевые решения, обучая модели на конкретных наборах данных и текстов. В процессе обучения любая модель получает доступ к большому объему информации, учится устанавливать связи и воспринимает заложенные в них социальные нормы. Так, например, обученная на текстах до начала 1930-х гг. модель исходит из чрезвычайной важности бога и политических реалий того времени.
Эффект выбора конкретных обучающих данных проявляется в различиях в зависимости от языка, на котором задаются вопросы. Ханна Уэйт из Орегонского университета с соавторами провела исследование, задавая GPT-3.5 от OpenAI и другим моделям политически окрашенные вопросы почти на 40 языках. Они обнаружили, что в языках с большим националистическим уклоном в обучающих текстах (обычно это страны с более репрессивными режимами) ответы моделей явно отражали эту особенность. И чем меньше в стране свободы СМИ (по оценке Всемирного индекса свободы прессы), тем более проправительственные ответы давали модели на языке этой страны по сравнению с ответами на английском.
Это подтверждает, что государственный контроль над СМИ прямо влияет на результаты выдачи больших языковых моделей, в том числе разработанных в других странах. В случае, например, Китая, где интернет подвергается жесткой цензуре со стороны властей, обученные на китайском языке модели неизбежно воспроизводят взгляды, которые так или иначе совпадают с позицией китайского правительства.
Кроме того, субъективные суждения проникают в модели через постобучение, когда их тестируют и дорабатывают, чтобы они не только выполняли инструкции, давали разумные ответы и соблюдали меры безопасности, но и «соответствовали» намерениям и ценностям создателей. Иногда проявляются политические и другие взгляды разработчиков. Сегодня модели обучают не просто следовать правилам, но и высказывать нечто вроде моральных суждений. Например, у американского разработчика Anthropic есть своя «конституция», в которой изложены основные принципы поведения моделей компании.
Новые версии западных больших языковых моделей с ИИ, как правило, уже не дают явно идеологизированных ответов. Тем не менее их предвзятость сохраняется. Классические примеры: модель Grok «категорически не согласна» с тем, что ее владелец Илон Маск ведет себя как нацист, а китайские модели не одобряют идею признания Тайваня независимым государством.
Китайские модели официально обязаны «поддерживать основные социалистические ценности», им запрещено противоречить официальной точке зрения правительства страны. Любопытно при этом, что они знают правду, но не говорят ее. Это показывает анализ внутренних рассуждений DeepSeek: китайские модели, по всей видимости, обучаются давать прокитайские ответы. Хотя есть и те, кто стремится устранить эту идеологическую предвзятость и доучивает модели. В то же время китайские компании в отличие от американских конкурентов не скрывают деталей внутренней работы своих новейших моделей, чем привлекают многих пользователей, в том числе разработчиков программного обеспечения.
Как отмечают наблюдатели, предвзятость моделей мало влияет на их практическое применение. Однако в некоторых сферах их использование может иметь далеко идущие, хоть и не очевидные, последствия, в том числе там, где это не связано с работой. Люди часто обращаются к ИИ за советом (например, о семейных отношениях) и все чаще делегируют ему принятие решений, хотя недостаточно глубоко понимают, как заложенные в модели ценности могут влиять на мышление пользователей.
Разобраться, как большие языковые модели влияют на политические взгляды и предпочтения, попробовал Джиллиан Фишер из Вашингтонского университета с соавторами. В ходе эксперимента в США он выяснил, что пользователи, изначально симпатизировавшие одной из партий (демократической и республиканской), но взаимодействовавшие с ангажированными моделями противоположной партии, меняли свои позиции, особенно когда заранее не знали о предвзятости модели. А The Economist выяснил (при анализе на английском языке), что самые популярные американские модели в основном придерживаются демократических взглядов, хотя Grok от компании Илона Маска xAI занимает более центристские позиции в экономических и социальных вопросах, а китайская DeepSeek V3.2 является консервативной в социальных вопросах.
Инструменты с ИИ уже сейчас способствуют распространению в обществе искаженного мировоззрения. С распространением различных моделей и их большей доступностью для населения самых разных стран эта проблема будет только нарастать, тем более что обучение и закладываемые в модели ценности вряд ли изменятся. Поэтому, как и с другими передовыми технологиями, важно, в чьих интересах и для каких целей они применяются.
Личное отношение ИИ
Ангажированность ИИ проявляется не только в мировоззрении, но и, например, в отношении к конкретным людям. Группа исследователей из Университета Гента попросила 19 популярных больших языковых моделей описать почти 4000 известных личностей, имеющих отношение к политике, и оценила тональность, с которой модели говорили о каждом человеке. Выяснилось, что в разных геополитических регионах – в исследование вошли арабские страны, Китай, Россия и страны Запада – и на разных языках (шесть официальных языков Организации Объединенных Наций) идеологический контекст оказывается разным. Причем в случае, например, китайских моделей он различается в зависимости от того, ориентированы они на международный или на внутренний рынок. Авторы приходят к выводу, что идеологическая позиция моделей отражает мировоззрение их создателей, а чтобы создать инструмент для «беспристрастных» ответов, требуется комплекс как технологических, так и регуляторных мер.
Культура ИИ
Ученые из Амстердамского университета проанализировали то, как генеративные системы с ИИ транслируют социальные ценности, которые часто закладываются в них наряду с политическими идеалами и идеологией государственными институтами и бизнесом. Это, в свою очередь, может приводить к росту напряженности как внутри общества, так и между представителями разных групп. Авторы исследования показывают, что транслируемые чат-ботами ценности становятся частью технологической гонки между государствами и разными создателями моделей с генеративным ИИ. Например, китайские разработчики пытаются определить критерии, по которым модели оцениваются на соответствие национальной культуре. А в США идут дискуссии о приверженности американских больших языковых моделей воук-культуре и ее ценностям.