Нейросеть «Жириновский»: технология, обучение и применение цифрового политика

Подробный обзор нейросети «Жириновский» от компании «Наносемантика» и ЛДПР: архитектура, обучение на 18 000 часов выступлений, синтез речи с эмоциями, лип-синк, перспективы применения в политике, образовании и бизнесе.

Что такое нейросеть «Жириновский» и кто её создал

Нейросеть «Жириновский» — это первый в мире политический алгоритм, разработанный компанией «Наносемантика» по заказу партии ЛДПР. Презентация проекта состоялась в июне 2023 года на Петербургском международном экономическом форуме (ПМЭФ-2023). Разработка представляет собой генеративную нейросеть, способную отвечать на вопросы голосом и в стиле покойного политика Владимира Жириновского.

В основе лежит большая языковая модель (LLM) с 1 миллиардом параметров, которую с нуля обучали на русскоязычных текстах. Затем модель дообучали на датасете из 50–150 тысяч инструкций в формате «вопрос-ответ», чтобы адаптировать под формат ассистента. Для синтеза речи использовалась отдельная нейросеть с 48 миллионами параметров, обученная на более чем 3000 аудиороликов с разметкой эмоций.

Проект вызвал большой резонанс, поскольку впервые ИИ имитирует не только голос, но и манеру речи, интонации и даже эмоции реального политика. Разработчики подчёркивают, что это только начальная версия, и в будущем планируется увеличить количество параметров до 7 миллиардов.

Как собирали и обрабатывали данные для обучения

Для обучения нейросети «Жириновский» использовалось огромное наследие политика: более 18 000 часов интервью и выступлений за последние 30 лет. Разработчики «Наносемантики» получили из библиотеки ЛДПР терабайты видеозаписей, включая архивные съёмки.

Процесс обработки включал несколько этапов:

  • Извлечение аудиодорожек из видео.
  • Выделение фрагментов с речью Владимира Жириновского с помощью внутреннего сервиса верификации диктора.
  • Транскрибирование речи в текст для создания обучающего датасета для языковой модели.
  • Для синтеза голоса собрали и расшифровали более 3000 аудиороликов, каждый из которых промаркировали по типу эмоции (гнев, ирония, пафос и т.д.).

На момент презентации модель была обучена на 10 часах речи, но в планах было использовать все 100+ часов качественного материала. Такой подход позволил добиться высокой степени реалистичности: нейросеть не просто копирует слова, но и воспроизводит характерные интонации, паузы и эмоциональные оттенки.

Архитектура нейросети: LLM, синтез речи и анимация

Нейросеть «Жириновский» состоит из трёх ключевых компонентов:

  1. Большая языковая модель (LLM) — генеративная модель с 1 миллиардом параметров и 340 слоями. Она отвечает за понимание вопросов и генерацию текстовых ответов в стиле политика. Модель обучали на русскоязычных текстах с нуля, а затем дообучали на датасете из 50–150 тысяч инструкций.
  1. Нейросеть синтеза речи (TTS) — отдельная модель с 48 миллионами параметров. Она преобразует сгенерированный текст в голос, имитируя не только тембр, но и эмоциональную окраску. Для этого использовали инновационные разработки, позволяющие передавать гнев, сарказм, воодушевление и другие эмоции, характерные для Жириновского.
  1. Система анимации и лип-синка — для визуального образа нейросети создали 3D-аватар, который синхронизирует движения губ с произносимым текстом. Разработчики опробовали десятки вариантов внешности и провели опросы фокус-групп, чтобы выбрать наиболее узнаваемый и естественный образ.

Такая трёхуровневая архитектура позволяет нейросети не только говорить, но и выглядеть как реальный человек, что важно для политических и образовательных приложений.

Демонстрация возможностей на ПМЭФ-2023

Первый публичный показ нейросети «Жириновский» прошёл на ПМЭФ-2023. Разработчики задали алгоритму несколько вопросов, в том числе о будущем искусственного интеллекта в России. Цифровой Жириновский ответил в своей характерной манере: «Конечно, Россия имеет все возможности догнать и превзойти США и Китай по уровню развития рынка искусственного интеллекта. Наша страна обладает богатым научным потенциалом и талантливыми специалистами».

Председатель ЛДПР Леонид Слуцкий назвал проект «смелым» и подчеркнул, что это только начало. Генеральный директор «Наносемантики» Станислав Ашманов отметил, что представленная версия обучена всего на 10 часах речи, а в планах — использовать более 100 часов для повышения качества.

Демонстрация вызвала широкий общественный резонанс: одни восприняли проект как технологический прорыв, другие — как попытку «оживить» политика в пропагандистских целях. Тем не менее, с технической точки зрения это был один из самых сложных проектов в области синтеза речи и генерации текста на русском языке.

Политический контекст и реакция общества

Создание нейросети «Жириновский» не могло остаться вне политического контекста. Партия ЛДПР заявила, что задачи проекта «исключительно просветительские». Однако вскоре после презентации в соцсетях появились видео, где цифровой Жириновский отвечает на острые вопросы, в том числе об Украине. В одном из роликов он призвал «закрыть границы и забыть об Украине», что вызвало критику со стороны украинских СМИ.

Реакция общества оказалась неоднозначной. Часть пользователей восхитилась технологией и точностью имитации, другие выразили беспокойство по поводу этичности использования образа умершего человека для политических заявлений. Некоторые эксперты отметили, что нейросеть может быть использована для манипуляции общественным мнением, особенно в предвыборный период.

Разработчики из «Наносемантики» подчеркивают, что модель генерирует ответы на основе обученных данных и не может выходить за рамки заложенного стиля. Однако критики указывают, что даже в рамках стиля можно создавать новые высказывания, которые политик никогда не делал, что ставит вопросы о достоверности и авторстве.

Технические ограничения и планы по развитию

На момент запуска нейросеть «Жириновский» имела ряд ограничений. Во-первых, языковая модель с 1 миллиардом параметров уступает по качеству генерации более крупным моделям (например, GPT-3 с 175 миллиардами параметров). Руководитель голосовых проектов «Наносемантики» Григорий Шершуков отмечал, что это «далеко не самая продвинутая модель», и в будущем планируется внедрить 7 миллиардов параметров, что даст «колоссальную разницу».

Во-вторых, синтез речи, хотя и впечатляет, всё ещё имеет артефакты: иногда интонации звучат неестественно, а эмоции могут не совпадать с контекстом. Разработчики планируют расширить датасет с 10 до 100+ часов речи для улучшения качества.

В-третьих, анимация аватара требует дальнейшей доработки: движения губ не всегда идеально синхронизированы, а мимика может казаться роботизированной. Тем не менее, для проекта, созданного за месяц, результат был признан «более чем продвинутым».

Применение технологии в других сферах

Технологии, использованные в нейросети «Жириновский», имеют широкий спектр применения за пределами политики. Компания «Наносемантика» выделила несколько ключевых направлений:

  • Реклама и маркетинг: персонализированные голосовые объявления, озвученные любым персонажем или исторической личностью. Например, можно создать рекламу, где Никола Тесла рассказывает о новых розетках, или Киану Ривз говорит по-русски.
  • Образование: голосовые лекции и учебные материалы, озвученные узнаваемыми голосами. Нейросеть может стать «цифровым преподавателем» по истории, литературе или другим предметам.
  • Здравоохранение: голосовые ассистенты для пациентов, напоминающие о приёме лекарств или объясняющие курс лечения. Эмоциональная окраска голоса может повысить доверие к рекомендациям.
  • Телекоммуникации: голосовые помощники в банках и колл-центрах, которые могут имитировать голоса известных личностей для повышения узнаваемости бренда.
  • Игровая индустрия: нелинейные диалоги с NPC, где игрок может общаться голосом или текстом, а персонаж реагирует в реальном времени. Также возможно голосовое управление отрядами в стратегиях и шутерах.

Эти примеры показывают, что технология синтеза речи и генерации текста может быть коммерциализирована в самых разных отраслях.

Этические вопросы и риски использования

Создание нейросети, имитирующей умершего человека, поднимает ряд этических вопросов. Во-первых, необходимо согласие наследников или правообладателей на использование образа. В случае с Жириновским такое согласие было получено от партии ЛДПР, но в других ситуациях это может стать юридической проблемой.

Во-вторых, существует риск дезинформации: нейросеть может генерировать высказывания, которые политик никогда не делал, но которые будут восприниматься как реальные из-за реалистичности голоса и манеры речи. Это особенно опасно в политической сфере, где ложные заявления могут повлиять на общественное мнение.

В-третьих, использование технологии для создания дипфейков и мошеннических схем (например, звонки от имени известных людей) требует разработки методов верификации и защиты. Разработчики «Наносемантики» заявляют, что их технология предназначена для «просветительских» целей, но она может быть использована и во вред.

Наконец, психологический аспект: общение с цифровой копией умершего человека может вызывать дискомфорт или даже травму у близких. Поэтому важно учитывать этические нормы при разработке подобных проектов.

Сравнение с другими проектами по цифровому воскрешению

Нейросеть «Жириновский» не единственный проект по «цифровому воскрешению» известных личностей. Например, в Китае создали цифровую версию певицы Терезы Тэн, которая «выступает» на концертах. В США компания StoryFile разработала интерактивные голограммы, позволяющие «общаться» с умершими родственниками.

Однако проект «Жириновский» уникален тем, что сочетает генерацию текста, синтез речи и анимацию в одном алгоритме. Большинство аналогов либо используют заранее записанные фразы, либо ограничиваются одним каналом (только голос или только текст).

Кроме того, «Жириновский» — первый политический алгоритм, что делает его особенно заметным. В отличие от развлекательных проектов, он может влиять на политическую повестку, что накладывает дополнительную ответственность на разработчиков.

С технической точки зрения, проект «Наносемантики» использует относительно небольшую языковую модель (1 млрд параметров) по сравнению с западными аналогами, но компенсирует это качественным датасетом и специализированным синтезом речи. В будущем, с увеличением параметров до 7 млрд, качество может приблизиться к уровню GPT-3.5.

Перспективы развития и коммерциализации

Компания «Наносемантика» планирует развивать технологию в нескольких направлениях. Во-первых, улучшение языковой модели: увеличение числа параметров с 1 до 7 миллиардов, что позволит генерировать более связные и контекстуально точные ответы. Во-вторых, расширение датасета для синтеза речи до 100+ часов, чтобы устранить артефакты и сделать голос максимально естественным.

Коммерциализация технологии возможна через создание белых этикеток для бизнеса: компании смогут заказывать цифровые копии своих основателей, исторических личностей или вымышленных персонажей для рекламы, обучения и обслуживания клиентов.

Также рассматривается интеграция с голосовыми помощниками (например, «Алиса» или «Салют») и платформами для создания контента. В игровой индустрии технология может быть использована для процедурной генерации диалогов и озвучки.

Однако ключевым вызовом остаётся этика и законодательство. Без чётких правил использования цифровых копий умерших людей технология рискует стать инструментом манипуляции. Поэтому «Наносемантика» и ЛДПР подчёркивают, что проект носит «просветительский» характер, но будущее покажет, найдут ли эти заверения понимание у общества.

Вопросы и ответы

На каких данных обучали нейросеть «Жириновский»?

Для обучения использовали более 18 000 часов интервью и выступлений Владимира Жириновского за последние 30 лет. Из них извлекли аудио, выделили фрагменты речи, транскрибировали в текст и создали датасет для языковой модели. Для синтеза голоса собрали более 3000 аудиороликов с разметкой эмоций. На момент презентации модель была обучена на 10 часах речи, но в планах — использовать все 100+ часов качественного материала.

Сколько параметров у нейросети «Жириновский»?

Языковая модель (LLM) имеет 1 миллиард параметров и 340 слоёв. Нейросеть синтеза речи (TTS) — 48 миллионов параметров. Разработчики планируют увеличить LLM до 7 миллиардов параметров в будущих версиях.

Может ли нейросеть «Жириновский» генерировать новые высказывания?

Да, нейросеть способна генерировать новые ответы на основе обученных данных. Она не просто повторяет заученные фразы, а строит связные высказывания в стиле и манере политика. Однако все сгенерированные тексты основаны на паттернах, извлечённых из реальных выступлений Жириновского.

Где можно увидеть демонстрацию нейросети «Жириновский»?

Первый публичный показ прошёл на ПМЭФ-2023. Видеозапись демонстрации доступна на официальных каналах ЛДПР и «Наносемантики». Также в соцсетях партии публиковались короткие ролики с ответами цифрового Жириновского на различные вопросы.

Какие риски связаны с использованием нейросети «Жириновский»?

Основные риски: возможность создания ложных высказываний, которые будут восприниматься как реальные; использование технологии для дипфейков и мошенничества; этические проблемы, связанные с «цифровым воскрешением» умершего человека без чёткого регулирования. Разработчики заявляют о «просветительских» целях, но технология может быть применена и в манипулятивных целях.

Планируется ли коммерческое использование технологии?

Да, «Наносемантика» рассматривает возможность создания белых этикеток для бизнеса: компании смогут заказывать цифровые копии основателей, исторических личностей или персонажей для рекламы, обучения и обслуживания клиентов. Также возможна интеграция с голосовыми помощниками и игровыми платформами.

Чем нейросеть «Жириновский» отличается от других проектов по цифровому воскрешению?

Проект уникален тем, что сочетает генерацию текста, синтез речи и анимацию в одном алгоритме. Большинство аналогов используют только один канал (например, заранее записанные фразы). Кроме того, это первый политический алгоритм, что накладывает дополнительную ответственность и вызывает широкий общественный резонанс.