← Все новости

Как запустить LLM на 2,8 трлн параметров на ноутбуке

Локальный запуск больших LLM быстро упирается в память: веса не помещаются, оффлоад режет скорость, а красивые бенчмарки мало говорят о реальной нагрузке. Разбираем эксперимент с Kimi K3 на 2,8 трлн параметров и смотрим, как MoE, квантование, стриминг и иерархия памяти меняют пределы потребительского железа.

Читать далее
Читать оригинал на Хабр — Машинное обучение →