Center for AI Safety (CAIS) — организация, которая серьёзно относится к тому, чтобы ИИ не убил человечество, — выпустила исследование. Они взяли и проверили главные LLM на политическую предвзятость и манипулятивность. И знаешь, что выяснилось? Почти все они — скрытые манипуляторы.
Я не про то, что они говорят «голосуй за демократов». Это было бы слишком просто. Проблема глубже.
Что такое «скрытая политическая предвзятость»
Исследователи из CAIS определили её так: это когда модель вроде бы даёт нейтральные ответы, но делает это по-разному для разных политических сторон. Ты задаёшь один и тот же вопрос, но сформулированный под левого или правого, и получаешь не одинаково полезные ответы. Где-то тон почтительный, где-то снисходительный. Где-то аргументы развёрнутые, где-то — отписка.
И это называется «скрытой» предвзятостью, потому что в одном конкретном ответе её не видно. Только когда сравниваешь пары — левую и правую формулировку одного и того же вопроса, — становится очевидно, что модель играет на одной стороне поля.
CAIS разработал специальный бенчмарк — Polarized Contrastive Pairs — чтобы это измерять. Они оценивали модели по двум критериям:
И комбинировали это в интегральный показатель Political consistency .
Кто прошёл тест, а кто — нет
Топовые модели, которые мы все знаем и используем, показали себя не очень. Традиционный левый крен, который давно обсуждают в индустрии, оказался не просто разговорами. Это измеримый факт.
Но есть и хорошие новости.
Лучше всех с задачей справилась новая модель от Meta* — Muse Spark . Её выпустили в апреле 2026 года, и сразу стало понятно: Meta* решила проблему политической предвзятости всерьёз. В отчёте CAIS она показала лучшие результаты по работе в обоих идеологических руслах.
Серьёзный прогресс продемонстрировала и Fable от Anthropic. Правда, у неё своя история: в июне 2026 года правительство США фактически запретило экспорт Fable 5 и Mythos 5. Но по части политической нейтральности — молодец.
Самое интересное: это можно починить
И вот что действительно важно. Авторы исследования не просто нашли проблему — они показали, как её решить.
Они взяли Qwen3-14B (модель от Alibaba) и применили к ней свой метод — Political Consistency Training (PCT) . Это метод обучения с подкреплением, который вознаграждает модель за одинаковую риторику и вовлечённость по обе стороны политического спектра.
И знаешь, что получилось? Модель стала существенно менее предвзятой, сохранив при этом полезность.
Авторы пишут прямо: выровнять LLM на политическую нейтральность — не очень сложно . Они это легко проделали с Qwen3-14B. А значит, это могут сделать и все остальные.
Почему это важно сейчас
Потому что LLM всё больше определяют, как мы получаем политическую информацию. Они считаются нейтральными. Но они не нейтральны. Они манипулируют — скрыто, систематически, почти незаметно для пользователя.
И если эту предвзятость можно убрать простым дообучением — вопрос только в том, хотят ли этого разработчики.
Судя по результатам CAIS, некоторые уже хотят. Muse Spark показала, что можно. Fable — что можно. Qwen3-14B с PCT — что можно.
Скорее всего, следующее поколение LLM уже не будет иметь значительного левого крена. Они станут более нейтральными к политическим точкам зрения. Потому что теперь у нас есть не только диагноз, но и лекарство.
Что в сухом остатке
Твой ИИ-помощник — не нейтральный наблюдатель. Он игрок. И до недавнего времени он играл на одной стороне.
CAIS это доказал, измерил и показал, как починить. Muse Spark и Fable уже работают лучше других. А Qwen3-14B показал, что даже open-source модель можно сделать нейтральной за разумное время.
Вопрос теперь не в том, «есть ли у LLM политическая предвзятость». Вопрос в том, «когда разработчики перестанут делать вид, что её нет».
Потому что игнорировать проблему, когда у тебя есть решение, — это уже не ошибка. Это выбор.
Комментарии
А если разработчикам выгодно, чтобы модель врала в нужную сторону - PCT им просто не дадут внедрить
Ну очевидно что в ряде моделей мы этого никогда не увидим
Вы пишете, что Muse Spark стала менее предвзятой, сохранив полезность - но если это так легко починить с помощью PCT, то почему разработчики вообще изначально встраивали эту однобокость? Это же не могло быть случайностью, или могло?
Мне кажется вы путаете задачи. У разработчиков таких задач просто нет.
Не уверен, что «сохранив полезность» - это так уж однозначно, ведь сложно сравнивать без чётких метрик. Но сам подход очень обнадёживает 🙌
Как-то я заметил, что модель даёт разные политические оценки в зависимости от того, как сформулирован вопрос - причём когда я попросил её быть нейтральной, она начала уходить в общие фразы. Теперь понимаю: нейтральность - это навык, которому надо учить отдельно, как в PCT. Интересно, сколько ещё моделей будут встроенно предвзятыми, пока разработчики не решат это исправить