Google научила нейросеть монтировать видео через чат. На что способна Gemini Omni

admin


Если взглянуть на то, что происходит с искусственным интеллектом прямо сейчас, возникает чувство, что технологические компании только и делают, что стремятся перевернуть представления о создании контента с ног на голову. Google на своей ежегодной конференции в мае 2026 года выкатила нечто, что сложно уложить в голове с первого раза: мультимодальную линейку моделей под названием Gemini Omni. Первая и пока единственная публичная версия серии, Gemini Omni Flash, уже раздается подписчикам и работает так, что даже скептикам есть о чем задуматься. Речь идет не о чате с картинками и не об очередном улучшенном поиске, а о полноценном инструменте для создания и редактирования видео с голосом при помощи обычного текстового диалога. Не нужны ни монтажные программы, ни пресеты. Модель в своей работе опирается на реально существующую информацию, и потому выдает неплохой контент даже в том случае, если использовался достаточно короткий промпт. Вместе с командой Креатор Проджект рассмотрим прочие особенности новой модели от Google.

Что умеет и как работает нейросеть

Концепция, лежащая в основе Omni Flash, достаточно проста, но за ней стоит немало технической работы: модель принимает на вход почти что угодно. Фотографии, текстовые описания, аудиозаписи, уже готовые видеоролики… Все это можно скормить ей одновременно, и на выходе получится один связный видеоклип со звуком. Длина ролика на старте ограничена десятью секундами, и это сознательное решение Google, а не ограничение самой архитектуры. Компания хочет сначала справиться с нагрузкой на серверы, прежде чем открывать доступ к более длинным форматам.

Главное отличие от конкурентов заключается в возможностях диалогового редактирования. Вместо того чтобы каждый раз переписывать промпт с нуля и получать совершенно новый ролик, здесь можно просто написать: «перенеси сцену на пляж» или «поменяй угол камеры». Модель внесет правки и при этом (в большинстве случаев) не сломает логику уже сгенерированного видео. Персонажи остаются теми же. Физика объектов сохраняется, общий смысл не рассыпается. Лишь на первый взгляд все это кажется мелочью. На практике же такого рода детали меняют весь подход к работе с генеративным видео.

Физика в Omni Flash – вообще отдельная тема для разговора. Модель понимает гравитацию, движение жидкостей, кинетику. Google показывала на презентации не только красивые сцены с движущимися объектами, но и научные объяснения в анимированном формате. Например, процесс сворачивания белков в стиле пластилиновой анимации. Конечный результат выглядит убедительно именно потому, что объекты в кадре ведут себя так, как им и положено по законам природы, а не как в старых нейросетевых роликах, в которых вода текла вверх, а руки у людей заканчивались девятью пальцами.

Еще одна возможность, которую Google анонсировала с гордостью, заключается в возможности создания персонального аватара. Пользователь загружает собственные материалы. После этого аватар можно вставлять в новые ролики и генерировать их уже только по текстовому описанию. Редактирование чужого голоса и звука при этом пока недоступно; компания намеренно придерживает эту функцию, пока не проработает механизмы безопасного использования. Судя по тому, как осторожно Google подходит к теме дипфейков, ждать открытия голосового редактора придется не один месяц.

Кому открыт доступ и что с безопасностью?

Схема распространения у Omni Flash неожиданно демократичная (по крайней мере, частично). Подписчики платных планов Google AI Plus, Pro и Ultra получили доступ через приложение Gemini и сервис Google Flow сразу в день запуска. Авторы, работающие с короткими форматами, могут пользоваться инструментом бесплатно через YouTube Shorts и приложение YouTube Create. Разработчики и корпоративные клиенты пока ждут появления API. Google обещала открыть его в течение нескольких недель после анонса.

Что касается безопасности, Google не стала делать вид, что проблемы не существует. Каждый ролик, созданный через Omni Flash, автоматически получает скрытую цифровую метку SynthID. Это невидимый водяной знак, который сохраняется при публикации в социальных сетях и позволяет идентифицировать контент как сгенерированный ИИ. Проверить происхождение видео можно через приложение Gemini, браузерное расширение Gemini в Chrome или обычный поиск Google. Интересно, что SynthID уже приняли на вооружение и другие крупные игроки рынка, среди которых OpenAI, Nvidia, ElevenLabs. Стандарт постепенно становится отраслевым.

Можно ли назвать Gemini Omni Flash лучшей в своем роде?

Называть обозреваемую модель безусловным лидером рынка было бы преувеличением. Независимые тесты показывают, что по чистому качеству генерации некоторые конкуренты пока держат позиции. Однако уникальность Omni Flash не в том, чтобы рисовать самые красивые кадры, а в том, как устроен весь рабочий процесс. Диалоговое редактирование, мультимодальный ввод и глубокая интеграция в уже знакомые платформы вроде YouTube и Google Flow делают его принципиально другим продуктом.

Google анонсировала и следующую модель серии – Omni Pro. По словам представителей компании, она появится тогда, когда будет демонстрировать ощутимый, а не косметический прирост возможностей по сравнению с Flash. Когда именно это произойдет, вопрос пока что открытый. Сейчас же Gemini Omni Flash остается первым публичным шагом Google к тому, что компания сама называет движением в сторону искусственного интеллекта общего назначения. Шаг, надо признать, заметный.



Источник

Вам также может понравиться

Оставить комментарий