«Сбер» выпустил модель Kandinsky 6.0 Video для генерации видео с речью и музыкой
Команда «Сбера» представила Kandinsky 6.0 Video — модель, которая генерирует видео вместе с синхронным звуком, включая речь, музыку и шумы окружения.
Максимальная длительность роликов пока ограничена пятью секундами, но разработчики планируют её увеличить. Модель доступна в «ГигаЧате» и на Hugging Face.Для генерации надо описать сцену на естественном языке или загрузить первый кадр с описанием происходящего.
habr.com