AI-Vector
Свежие новости ИИ: инвестиционные раунды, IPO AI-стартапов, финансовые отчеты Google, Microsoft и OpenAI.
  • Новости
  • Генерация видео
  • Генерация изображений
  • Генерация звука
  • Генерация текста
  • Обзор сервисов
Категория:

Новости

    Новости

    Сбер выложил Kandinsky WM 1.0 — видеомодели для обучения роботов и беспилотников

    admin 27.08.2026


    Сбер выложил в открытый доступ Kandinsky WM 1.0 — три модели, которые достраивают видео по первому кадру и удерживают физику сцены. Код и веса опубликованы под лицензией MIT. Ролики нужны, чтобы обучать роботов и беспилотные автомобили редким ситуациям.

    Содержание

    1. Данных с дорог физически мало
    2. Три модели под три домена
    3. Награда за правдоподобную физику
    4. Топ-10 при 2 млрд параметров
    5. Что даёт лицензия MIT
    6. Следующий шаг — интерактивная среда

    WM в названии расшифровывается как World Model , «модель мира». Kandinsky WM 1.0 получает на вход первый кадр сцены и подробное описание на английском, а дальше строит пятисекундное продолжение. Внешнего сходства для таких задач мало: предметы должны сохранять форму и двигаться по законам физики. Основой послужила Kandinsky 5.0 Video Lite на 2 млрд параметров; поверх неё Сбер обучил три отдельные модели под три области.

    Данных с дорог физически мало

    Обучать беспилотник нужно на редких ситуациях: внезапное перестроение соседа, пешеход в неположенном месте, авария на перекрёстке. Именно их почти нет в реальных записях. Автомобиль, который снимает дорогу круглый год без остановки, соберёт меньше 10 тысяч часов синхронных сцен, и почти всё это будет движением в потоке и стоянием на светофорах. Для сравнения: NVIDIA обучала свою Cosmos на 20 млн часов видео.

    В робототехнике та же история. Каждый эпизод требует живого робота, оператора, набора датчиков и последующей проверки, а часть нужных ситуаций небезопасно воспроизводить вживую. Отсюда идея закрыть пробел синтетикой — при условии, что сгенерированное видео не тащит в датасет собственные ошибки модели.

    Три модели под три домена

    Сбер собрал три непересекающиеся выборки и обучил на них отдельные версии Kandinsky:

    • K5-AV — автомобильные сцены, 1,5 млн роликов на основе открытого датасета NVIDIA;
    • K5-RO — робототехника, 2,2 млн роликов, самая большая выборка из трёх;
    • K5-PH — сложная физика: жидкости, разрушения, деформации, движение людей, 1,6 млн роликов.

    Данные для K5-RO взяли из открытых наборов с реальными бытовыми сценами — складывание одежды, работа с крышками и молниями, кухонные задачи. Для сложной физики 300 тысяч роликов отбирали вручную асессоры Сбера, остальное отфильтровали автоматикой по качеству и динамике.

    Награда за правдоподобную физику

    Дообучение на профильных данных само по себе физику не чинит, поэтому Сбер добавил второй этап. Для дорожных и робототехнических сцен взяли обучение с подкреплением: отдельная модель-оценщик учится отличать настоящее видео от сгенерированного, опираясь на форму объектов, глубину сцены и характер движения, а генератор подстраивается так, чтобы получать от неё высокую оценку.

    Со сложной физикой этот подход дал слабый результат. Там, где ткань мнётся, а человек двигается, естественная деформация легко читается оценщиком как ошибка. Для K5-PH применили другой метод: модель во время обучения намеренно уводят с правильной траектории и учат возвращаться обратно, без внешнего судьи.

    Топ-10 при 2 млрд параметров

    Kandinsky WM 1.0 проверяли на трёх бенчмарках для Physical AI: 4-е место на PAI-Bench-G, 5-е на Physics-IQ Verified и 6-е на RBench. Модели, стоящие выше, крупнее на один-два порядка. В целевых доменах Kandinsky обошла NVIDIA Cosmos-Predict2.5-2B, ближайшую к себе по размеру: примерно на 5 процентных пунктов в автомобильных и робототехнических сценариях, на 2–3 пункта в индустрии и сценах с людьми.

    Здесь Сбер честно оговаривается, и оговорку легко пропустить: все места и метрики получены в собственной валидации команды по опубликованным процедурам бенчмарков, а не через официальную подачу в лидерборд. Цифры от этого не перестают быть цифрами, но проверить их придётся сообществу — благо веса выложены.

    Что даёт лицензия MIT

    MIT — самая свободная из ходовых лицензий: модель можно брать в коммерческие проекты, дообучать и встраивать в свои продукты, сохранив упоминание авторства. Веса Kandinsky WM 1.0 лежат на GitHub, GitVerse и Hugging Face, размер в 2 млрд параметров позволяет запускать модель без серверной фермы. Работает она в режиме «кадр плюс описание», причём промпт нужен английский и подробный — с описанием объектов, действия и ожидаемой динамики. Сбер сообщает, что модели уже используют его Центр робототехники и институт AIRI.

    Следующий шаг — интерактивная среда

    По функциональной классификации моделей мира Kandinsky WM 1.0 пока остаётся рендерером: она рисует наблюдение, но не держит состояние мира и не отвечает на действия. Дальше по этой лестнице стоят Genie 3 у Google DeepMind, Cosmos 3 у NVIDIA и GWM-1 у Runway — среды, которые реагируют на команду и позволяют проверить несколько вариантов будущего. Туда же собирается двигаться и команда Сбера. Пока же в открытом доступе появилась рабочая заготовка мирового уровня по метрикам и российская по происхождению — редкое сочетание для этой части рынка.



    Источник

    27.08.2026 0 комментариев
    0 VKOdnoklassnikiEmail
  • Новости

    Google выпустила на iOS офлайн‑приложение для диктовки Google AI Edge Eloquent

    admin 27.08.2026
    27.08.2026

    Google без лишнего шума выпустила на iOS ориентированное на работу офлайн приложение для диктовки под названием «Google AI Edge Eloquent», …

    0 VKOdnoklassnikiEmail
  • Новости

    OpenAI открыла бесплатным пользователям ChatGPT безлимитные чаты на GPT-5.6 Luna

    admin 26.08.2026
    26.08.2026

    OpenAI переводит бесплатных и Go-пользователей ChatGPT на GPT-5.6 Luna. С этой недели модель становится дефолтной, а со следующей — снимает …

    0 VKOdnoklassnikiEmail
  • Новости

    Полиция Сан‑Франциско арестовала подозреваемого в нападении с коктейлем Молотова на дом Сэма Альтмана

    admin 26.08.2026
    26.08.2026

    Полиция Сан-Франциско арестовала 20-летнего мужчину, подозреваемого в том, что ранним утром в пятницу он бросил коктейль Молотова в дом генерального …

    0 VKOdnoklassnikiEmail
  • Новости

    Anthropic смягчила биологические фильтры Claude Fable 5

    admin 25.08.2026
    25.08.2026

    Anthropic переписала биологический классификатор Claude Fable 5: доля ошибочных переключений на слабую модель упала примерно на 85%. Fable 5 чаще …

    0 VKOdnoklassnikiEmail
  • Новости

    OpenAI запустила новую подписку Pro за $100, чтобы бросить вызов Claude

    admin 25.08.2026
    25.08.2026

    OpenAI запустила новую подписку Pro за 100 долларов — по сути, на уровне цен Claude, у которого тоже есть подписка …

    0 VKOdnoklassnikiEmail
  • Новости

    Google DeepMind научила ИИ предсказывать ураганы на сутки раньше

    admin 24.08.2026
    24.08.2026

    Google DeepMind опубликовала в Nature исследование WeatherNext Cyclones: модель предсказывает путь, силу и структуру ветра циклона на трое суток вперёд …

    0 VKOdnoklassnikiEmail
  • Новости

    OpenAI заперла свою следующую модель Astra в изоляции

    admin 23.08.2026
    23.08.2026

    Будущая модель OpenAI под именем Astra на внутренних испытаниях так выросла в кибербезопасности, что компания больше не может исключить у …

    0 VKOdnoklassnikiEmail
  • Новости

    Крупнейший дата-центр на орбите начал коммерческую работу

    admin 23.08.2026
    23.08.2026

    Крупнейший вычислительный кластер, находящийся сейчас на орбите, был запущен канадской Kepler Communications в январе и включает около 40 Nvidia Orin …

    0 VKOdnoklassnikiEmail
  • Новости

    ByteDance открыла публичный API Seedance 2.5

    admin 22.08.2026
    22.08.2026

    7 августа Volcano Engine открыла публичный API Seedance 2.5 — видеомодели ByteDance, которая одним проходом собирает 30-секундный ролик в 4K …

    0 VKOdnoklassnikiEmail
Новые
Старые

Свежие записи

  • Google отвечает ИИ-браузерам конкурентов: в Chrome появились ИИ-агент и боковая панель с Gemini
  • ElevenLabs добавила генерацию речи, музыки, изображений и видео в MCP
  • ИИ‑ассистент Kiro спровоцировал 13‑часовой сбой Amazon Web Services
  • Пентагон пригрозил Anthropic: откройте ИИ для неограниченного военного применения — или лишитесь контракта
  • Уход Фила Спенсера запускает «ИИ-поворот» в Xbox и игровом бизнесе Microsoft

Свежие комментарии

Нет комментариев для просмотра.

Новые статьи

  • Google отвечает ИИ-браузерам конкурентов: в Chrome появились ИИ-агент и боковая панель с Gemini

    16.09.2026
  • ElevenLabs добавила генерацию речи, музыки, изображений и видео в MCP

    15.09.2026
  • ИИ‑ассистент Kiro спровоцировал 13‑часовой сбой Amazon Web Services

    15.09.2026
  • Пентагон пригрозил Anthropic: откройте ИИ для неограниченного военного применения — или лишитесь контракта

    15.09.2026
  • Уход Фила Спенсера запускает «ИИ-поворот» в Xbox и игровом бизнесе Microsoft

    14.09.2026
  • Burger King тестирует ИИ-гарнитуры, которые подсказывают рецепты и контролируют запасы и качество обслуживания

    14.09.2026

Рубрики

  • Генерация видео (113)
  • Генерация звука (23)
  • Генерация изображений (88)
  • Генерация текста (68)
  • Новости (119)
  • Обзор сервисов (85)

Google отвечает ИИ-браузерам конкурентов: в Chrome появились ИИ-агент...

16.09.2026

ElevenLabs добавила генерацию речи, музыки, изображений и видео...

15.09.2026

ИИ‑ассистент Kiro спровоцировал 13‑часовой сбой Amazon Web Services

15.09.2026

Пентагон пригрозил Anthropic: откройте ИИ для неограниченного военного...

15.09.2026

Уход Фила Спенсера запускает «ИИ-поворот» в Xbox и...

14.09.2026

Обзоры

  • ИИ‑ассистент Kiro спровоцировал 13‑часовой сбой Amazon Web Services

    15.09.2026
  • Пентагон пригрозил Anthropic: откройте ИИ для неограниченного военного применения — или лишитесь контракта

    15.09.2026
  • Уход Фила Спенсера запускает «ИИ-поворот» в Xbox и игровом бизнесе Microsoft

    14.09.2026

Выбор редакции

  • Anthropic и OpenAI получили C+ за контроль над своими ИИ-агентами

    11.09.2026
  • xAI дала ИИ-агентам собственный компьютер и логины от рабочих сервисов

    19.08.2026
  • Google выпустила DiffusionGemma: текст блоками и до 4x ускорение генерации

    18.07.2026

Популярное

  • 1

    Wan2.2 научилась рисовать: видеомодель от Krea теперь создаёт впечатляющие изображения по запросу

    24.06.2026
  • 2

    Промты для открытки на 23 февраля: +нейросети для создания открытки

    21.06.2026
  • 3

    Google встроил в Gemini генератор музыки Lyria 3

    21.06.2026
  • Pinterest
  • Youtube
  • Email
  • Vk
  • Rss
  • Yandex

@2026- All Right Reserved.


Наверх
AI-Vector
  • Новости
  • Генерация видео
  • Генерация изображений
  • Генерация звука
  • Генерация текста
  • Обзор сервисов