← All news

Как думает LLM: строим ChatGPT с нуля за десять шагов

Если открыть статью про GPT или Llama, то сразу можно встретить Embeddings, Self-Attention, KV Cache, Multi-Head Attention и прочие термины. Обычно предполагается, что читатель сразу готов разбираться в архитектуре Transformer на миллиарды параметров.

Но исторически языковые модели развивались постепенно. Сначала появились простые статистические модели, затем RNN, позже механизмы Attention, и только потом Transformer. Каждый новый шаг решал вполне конкретные ограничения предыдущего подхода.

В этой статье мы повторим тот же путь. Начнём с игрушечной языковой модели на нескольких десятках параметров и шаг за шагом дойдём до архитектуры современных LLM. Заодно станет понятнее, почему система, обученная предсказывать следующий токен, в итоге научилась писать код, отвечать на вопросы и решать задачи.

Читать далее
Read original at Хабр — Искусственный интеллект →