
Коротко о главномРазвернутьСвернуть
- Это модель Mixture-of-Experts (MoE) с тернарным квантованием весов, которая работает очень быстро: 218 токенов в секунду на Mac Mini M4.
- Главные особенности Maple-Preview: Архитектура: 24 слоя, 256 экспертов, из которых для каждого токена используются только 8.
- Параметры: Всего 20 миллиардов, из которых активны 1 миллиард (20B-A1B).
Это модель Mixture-of-Experts (MoE) с тернарным квантованием весов, которая работает очень быстро: 218 токенов в секунду на Mac Mini M4. Главные особенности Maple-Preview: Архитектура: 24 слоя, 256 экспертов, из которых для каждого токена используются только 8. Параметры: Всего 20 миллиардов, из которых активны 1 миллиард (20B-A1B). Веса: Тернарные, что означает примерно 2 бита на параметр. Контекст: Обрабатывает до 131 072 токенов.
Размер: Всего 5. 31 ГБ. Внимание: Использует скользящее окно (SWA-512) и глобальное внимание в соотношении 3:1, а также нормализацию Q/K RMS и FFN MoE с SiLU-гейтом (как в DeepSeek v4). Производительность и железо: Самое впечатляющее - это скорость генерации. Авторы заявляют, что на обычном Mac mini с чипом M4 модель выдает до 218 токенов в секунду при работе на CPU. Это намного быстрее, чем у многих других моделей такого же размера.
Благодаря тому, что модель занимает всего около 5 ГБ, она помещается в оперативную память большинства современных компьютеров. Это открывает возможности для создания локальных помощников, которые могут работать с длинным контекстом и помогать с кодом, не отправляя ваши данные в облако. Ссылки: Github HF Хабы: Искусственный интеллект


