Когда мы говорим об искусственном интеллекте, чаще всего представляем чат-боты: пользователь задает вопрос, просит сократить текст, придумать заголовок, написать пост или быстро найти главное в большом объеме информации. Но сегодня искусственный интеллект уже давно вышел за пределы текстовых задач. Он становится частью медиапроизводства: помогает создавать изображения, музыку, озвучку, короткие видеоролики, заставки, обложки и отдельные визуальные элементы для социальных сетей и редакционных материалов.
Для журналистики и медиа это особенно важно, потому что искусственный интеллект постепенно превращается не в отдельный эксперимент, а в рабочий инструмент. Это означает, что часть задач решается быстрее.
Нейросети могут помочь создать визуальную перебивку, заставку, фон, короткий анимированный фрагмент, иллюстрацию к новости или ролик для социальных сетей. При этом пока чаще речь идет не о полноценном фильме, созданном искусственным интеллектом с нуля, а именно о небольших элементах: коротких видео, анимированных картинках, промо-фрагментах, титрах, обложках и визуальных вставках. Генерация видео остается более сложной и дорогой задачей, чем работа с текстом или изображением, потому что требует больших вычислительных ресурсов.
Важную роль ИИ играет и в монтаже. Искусственный интеллект – это не только отдельный чат-бот или генератор картинок. Это еще и алгоритмы, встроенные в привычные программы и сервисы. Например, автоматическое удаление фона, распознавание лица или объекта в кадре, создание субтитров, расшифровка речи, подбор ключевых фрагментов, генерация описания к ролику или тайм-кодов. То, что раньше требовало длительной ручной работы, сейчас часто можно сделать за несколько минут. Для редакций, которые производят много короткого информационного контента, это особенно ценно.
Самое важное в видео, особенно для социальных сетей, – это использование музыки. Различные генеративные модели позволяют создавать музыкальный ряд. Раньше часто возникала проблема использования музыки с точки зрения авторского права. Сейчас можно создавать музыкальные подложки с помощью нейросетей: задавать жанр, настроение, длительность, структуру композиции и наличие или отсутствие вокала.
Сервисы вроде Suno, Udio и Stable Audio дают возможность быстро получить фоновую музыку для ролика. Это частично решает проблему авторских прав на популярные треки, но одновременно создает новые вопросы: кому принадлежит сгенерированная музыка, на каких данных обучалась модель и можно ли свободно использовать такой результат в коммерческом или редакционном контенте.
Нейросетевые инструменты позволяют «начитать» текст, подобрать голос, изменить интонацию, сделать аудиосопровождение для короткого ролика или мультимедийного материала. Для образовательных, новостных и развлекательных форматов это открывает новые возможности: небольшой сценарий можно быстро превратить в аудио или видео. Но здесь снова возникает вопрос ответственности: если голос похож на реального человека, если используется узнаваемая манера речи или цифровая копия, необходимо понимать, есть ли согласие на такое использование.
Ксения Конкина, кандидат филологических наук,
старший преподаватель факультета журналистики МГУ имени М. В. Ломоносова