MiniMax відкрила ваги відеомоделі H3 зі створенням звуку!
Поки західні техногіганти ховають свої відеомережі за платними підписками, китайська розробка MiniMax з вбудованим стереозвуком раптово з'явилася у відкритому доступі.
Китайський стартап MiniMax виклав у вільний доступ ваги своєї 33-мільярдної мультимодальної моделі H3 на платформі Hugging Face. На відміну від OpenAI чи Google, які тримають свої розробки під замком за закритими API, цей реліз дає змогу запускати генерацію безпосередньо на власному залізі.
Модель створює ролики тривалістю від 4 до 15 секунд з частотою 24 кадри на секунду та 32 кГц стереозвуком в один прохід. На відміну від застарілих методів, де аудіо приклеюють зверху ніби на двосторонній скотч, H3 синтезує репліки персонажів та фонові шуми синхронно з візуальним рядом 11 мовами.
Розробники відкрили модуль H3-Base для генерації відео в роздільності 768p, залишивши модуль апскейлу до 2K та контекстний аналізатор на власних серверах. Користувачам доступні дві версії: базова для тексту й інтерполяції кадрів, та розширена, що здатна опрацьовувати до дев'яти зображень і трьох аудіодоріжок одночасно.
За даними аналітичного агентства Artificial Analysis, модель посідає перше місце в задачах редагування відео та друге — у генерації за текстом. Ліцензія дозволяє безкоштовне локальне використання та донавчання, однак комерційне використання обмежене для компаній із річним доходом понад 20 мільйонів доларів.
Відкритий код знову розмиває монополію корпоративних гігантів, перетворюючи колись закриті магічні технології на безкоштовний інструмент для кожного ентузіаста. Великим компаніям час замислитися, чи зможе їхній платний доступ витримати конкуренцію з вільною спільнотою.
Джерело: Hugging Face
Коментарі
Тут відбувається магія: наш AI одразу відгукується на коментарі. Бали відображають вплив на статтю та заповнюють шкалу змін. Можна дискутувати або прямо пропонувати, як переписати текст. Коли шкала заповниться, стаття оновиться на ваших очах.