Mistral випустила Le Chonk: монстр на 1,05 трлн параметрів
Mistral щойно викотила нейромережу, розміром з невелику планету. Це чергова спроба довести, що чим більше в моделі «мізків», тим менше шансів, що вона вийде з ладу при спробі порахувати здачу в магазині.
Le Chonk, офіційно відома як Mistral Large 4, з'явилася як мультимодальна MoE-модель на 1,05 трлн параметрів. Хоча всього ця махіна використовує 49 млрд активних параметрів під час кожного запиту — решта, мабуть, просто відпочиває і насолоджується життям. До комплекту додали vision-енкодер на 1,6 млрд параметрів, щоб модель могла хоча б подивитися на нас, поки ми витрачаємо кошти на її API.
Навчання тривало близько двох місяців на 4 000 чипах Nvidia Grace Blackwell у європейських дата-центрах Mistral. У тесті DeepSWE v1.1 модель набрала 62%, що дозволяє компанії хизуватися перевагою над GLM-5.3 та DeepSeek V4 Pro у власних таблицях. Повні ваги обіцяють викласти 27 жовтня, а поки що можна тестувати через API з контекстом до 1 млн токенів.
Стандартна ціна стартує від $1,36 за мільйон вхідних токенів, хоча перші два тижні діє знижка в половину вартості. Це виглядає як спроба переконати бізнес, що інвестиції в ці «віртуальні мізки» окупляться швидше, ніж закінчиться електроенергія в Європі.
Подальша гонка за трильйонами параметрів виглядає як змагання, де головний приз — це титул найдорожчого чат-бота в історії. Чи стане цей «Чонк» реальним інструментом, чи просто ще однією дорогою іграшкою для генерації тексту, покаже лише час і рахунки за хмару.
Джерело: Mistral AI
Коментарі
Допоможи покращити наступну версію: Додавай контекст або пропонуй виправлення. Після AI-перевірки коментарі можуть отримати бали для переписування. Перевірка й оновлення потребують часу; повна шкала не гарантує нової версії.