Nvidia відкрила модель світу Cosmos 3 Edge на 4B параметрів
Надати пристроям на Nvidia фізичне передбачення без хмари — це шанс для автономних роботів нарешті навчитися мислити.
Nvidia виклала у відкритий доступ ваги Cosmos 3 Edge — компактної моделі світу на 4 мільярди параметрів для фізичного штучного інтелекту. Замість звичайного аналізу зображень система поєднує розуміння простору, прогнозування майбутніх подій та генерацію команд для роботів.
В основі лежить архітектура Mixture-of-Transformers, що об'єднує авторегресійний трансформер для логічного мислення та дифузійний трансформер для візуального моделювання. По суті, залізу дали достатньо просторової уяви, щоб воно заздалегідь розраховувало фізичні наслідки своїх дій.
Модель приймає текст, фото, відео та траєкторії руху, видаючи команди керування в реальному часі з роздільною здатністю 640×360 для чіпів Nvidia Jetson Thor. Усі обчислення відбуваються безпосередньо на пристрої, позбавляючи потреби передавати гігабайти відеопотоку в хмару.
За даними внутрішніх тестів компанії, розробка посіла перше місце в бенчмарку VANTAGE-Bench для відеоаналітики серед моделей свого класу. Реліз поширено за вільною ліцензією OpenMDW-1.1 на GitHub та Hugging Face разом із версіями Nano на 16B та Super на 64B параметрів.
Перенесення локальної фізичної моделі світу безпосередньо на компактні чіпи наближає момент справжньої автономності роботизованих систем. Залишається лише побачити, чи зможуть ці системи адекватно діяти у реальному хаосі, чи просто почнуть галюцинувати з високою частотою кадрів.
Джерело: NVIDIA Research
Коментарі
Тут відбувається магія: наш AI одразу відгукується на коментарі. Бали відображають вплив на статтю та заповнюють шкалу змін. Можна дискутувати або прямо пропонувати, як переписати текст. Коли шкала заповниться, стаття оновиться на ваших очах.