MiniMax открыла веса видеомодели H3 — одной из самых сильных open‑weight систем для генерации видео со звуком
Китайская компания MiniMax опубликовала веса своей видеомодели H3, выполнив обещание, данное во время релиза несколькими днями ранее.
Теперь разработчики могут скачать локальную версию модели, которая генерирует короткие видеоролики со встроенным стереозвуком по текстовым описаниям, изображениям, видеофрагментам и аудиореференсам.Для рынка генерации видео это важный момент: OpenAI, Google, Runway, Pika и большинство других лидеров по‑прежнему распространяют свои видеомодели только через API, тогда как MiniMax сделала доступной значительную часть собственной системы в формате open weights.По данным Reuters, H3 была представлена как мультимодальная модель нового поколения и изначально разрабатывалась с учетом возможности локального запуска и дальнейшей кастомизации пользователями.H3 — это 33-миллиардная мультимодальная модель, которая может принимать на вход:текст;изображения;видео;аудио;их комбинации.На выходе модель генерирует видео со звуком в одном проходе, без отдельного этапа озвучивания.Заявленные характеристики:длительность роликов — от 4 до 15 секунд;24 FPS;стереозвук 32 кГц;поддержка пропорций 21:9, 16:9, 4:3, 1:1, 3:4 и 9:16;поддержка реплик персонажей на 11 языках, включая русский.Важная особенность — звук генерируется той же моделью, которая создает видео, а не отдельным TTS‑ или аудиогенератором.MiniMax отдельно описывает архитектуру своей системы как трехступенчатый конвейер.Этот модуль анализирует весь пользовательский ввод — текст, изображения, видео и аудио — и переводит его во внутреннее представление, с которым далее работает генератор.Основной генератор видео.
habr.com