LLM

Как расшифровывается LLM

Аббревиатура раскрывается как Large Language Model — большая языковая модель. «Большая» здесь относится к объёму обучающих данных и к числу параметров модели, которое измеряется миллиардами. «Языковая» — к тому, что модель работает с последовательностями текста; программный код для неё такая же последовательность, как обычная речь.

Как это работает на базовом уровне

Текст запроса разбивается на токены — короткие фрагменты, примерно от части слова до целого слова. Модель обрабатывает эту последовательность и подбирает наиболее вероятное продолжение, токен за токеном, каждый раз с учётом доступного ей контекста. Ответ формируется постепенно, поэтому в интерфейсах он и появляется по частям.

Способность выбирать уместное продолжение появляется на этапе обучения: модель прошла через огромный корпус текстов и кода и усвоила статистические закономерности языка — грамматику, устойчивые конструкции, типичные структуры программ. Дополнительное дообучение учит её следовать инструкциям и отвечать в диалоговом формате.

Из этого следуют два практических вывода. Первый: модель не хранит факты как база данных и может уверенно выдать правдоподобную ошибку — такие ответы называют галлюцинациями. Второй: объём информации, который модель удерживает за один запрос, ограничен контекстным окном, и всё, что в него не поместилось, на ответ не влияет.

Для каких задач используются LLM

  • работа с текстом: написание, редактирование, перевод, краткое изложение, извлечение данных из документов;
  • ответы на вопросы и поиск по внутренней базе знаний компании;
  • обработка обращений: классификация, сортировка, черновики ответов;
  • работа с кодом — отдельная и одна из самых массовых областей применения.

В разработке LLM генерируют код по описанию, объясняют незнакомые участки, пишут тесты, разбирают причину ошибки по логу, проводят рефакторинг и помогают с ревью. Код удобен для моделей тем, что результат легко проверить: он либо компилируется и проходит тесты, либо нет.

Как LLM связаны с промптами и AI-IDE

Промпт — это вход модели, а контекст — то, на что она опирается при ответе. Сама по себе LLM не знает ни вашего проекта, ни задачи: всё нужное приходит в запросе. Поэтому вокруг моделей выросли инструменты, которые собирают контекст автоматически.

AI-IDE делает это на уровне проекта: подставляет открытые файлы, структуру репозитория, вывод терминала и правила команды, а ответ модели применяет прямо к файлам. Модель получает то, чего ей не хватает в отдельном чате, — доступ к рабочему окружению. Подробнее об устройстве больших языковых моделей — в статье «Что такое LLM» в блоге Kodik.

LLM — что это такое и для чего нужны большие языковые модели