Выпуск новостей завершён 15 сентября 2026. Материалы сохранены на дату публикации. Перейти к инструкциям →

Архив · Полный материал · Хабр

Встречайте Maple-Preview — новую открытую языковую модель от DeepGrove

Встречайте Maple-Preview: 20B-A1B тернарная MoE-модель, которая выдает 218 токенов в секунду на CPU (Mac Mini M4). Это в несколько раз превышает показатели многих классических плотных или разреженных моделей сопоставимого класса. Читать далее

ИИ · Хабрc46fd3da1 минута
Перейти к тексту ↓
Встречайте Maple-Preview — новую открытую языковую модель от DeepGrove
Хабр
Коротко о главномРазвернутьСвернуть
  1. Это модель Mixture-of-Experts (MoE) с тернарным квантованием весов, которая работает очень быстро: 218 токенов в секунду на Mac Mini M4.
  2. Главные особенности Maple-Preview: Архитектура: 24 слоя, 256 экспертов, из которых для каждого токена используются только 8.
  3. Параметры: Всего 20 миллиардов, из которых активны 1 миллиард (20B-A1B).

Это модель Mixture-of-Experts (MoE) с тернарным квантованием весов, которая работает очень быстро: 218 токенов в секунду на Mac Mini M4. Главные особенности Maple-Preview: Архитектура: 24 слоя, 256 экспертов, из которых для каждого токена используются только 8. Параметры: Всего 20 миллиардов, из которых активны 1 миллиард (20B-A1B). Веса: Тернарные, что означает примерно 2 бита на параметр. Контекст: Обрабатывает до 131 072 токенов.

Размер: Всего 5. 31 ГБ. Внимание: Использует скользящее окно (SWA-512) и глобальное внимание в соотношении 3:1, а также нормализацию Q/K RMS и FFN MoE с SiLU-гейтом (как в DeepSeek v4). Производительность и железо: Самое впечатляющее - это скорость генерации. Авторы заявляют, что на обычном Mac mini с чипом M4 модель выдает до 218 токенов в секунду при работе на CPU. Это намного быстрее, чем у многих других моделей такого же размера.

Благодаря тому, что модель занимает всего около 5 ГБ, она помещается в оперативную память большинства современных компьютеров. Это открывает возможности для создания локальных помощников, которые могут работать с длинным контекстом и помогать с кодом, не отправляя ваши данные в облако. Ссылки: Github HF Хабы: Искусственный интеллект