Искусственный интеллект
Что такое LLM
LLM (large language model, большая языковая модель) — программа, обученная продолжать текст. Всё, что она делает, сводится к одной операции: по уже написанному предсказать следующий кусочек и повторить.
В этой статье
Одна операция, повторённая тысячу раз#
Диалог выглядит как беседа, но внутри происходит другое. Система склеивает
инструкцию разработчика, историю переписки и твой последний вопрос в один
длинный текст и просит модель его продолжить. Модель выдаёт один кусочек,
он приписывается к тексту, и всё повторяется — пока не выпадет специальный
признак конца.
Отсюда бытовое наблюдение: модель начинает отвечать раньше, чем «придумала»
концовку. Плана целого ответа у неё нет. Если первое предложение свернуло
не туда, дальше она будет честно продолжать этот неудачный поворот — это
одна из причин, почему переформулированный вопрос часто даёт ответ лучше,
чем просьба «попробуй ещё раз».
Токены: не слова и не буквы#
Текст режут на токены — куски примерно в 3–4 знака для английского и
обычно короче для русского, потому что кириллица в словарях представлена
скромнее. Частое слово может быть одним токеном, редкое или составное
распадётся на несколько, знаки препинания и пробелы тоже занимают место.
Токены важны по трём причинам. Ими измеряется длина запроса и ответа. Ими
же считается стоимость обращения к платным моделям. И именно из-за
токенизации модели плохо даются задачи на буквы: посчитать, сколько «о» в
слове, ей мешает то, что слова целиком она как набор букв не видит.
Откуда берётся то, что выглядит знанием#
Модель обучали на огромном корпусе текстов: сайты, книги, документация,
форумы, код. В ходе обучения она подбирала внутренние коэффициенты так,
чтобы точнее угадывать спрятанное продолжение. Никакой базы фактов при
этом не собирается — получается статистика того, какие слова и мысли
обычно идут рядом.
Поэтому знания модели размыты. Общеизвестное она воспроизводит надёжно,
редкое — приблизительно, а то, чего в текстах почти не было, достраивает по
образцу. Механика этого подбора коэффициентов разобрана отдельно: как
работает нейросеть.
После основного обучения модель дополнительно настраивают на примерах
диалогов и человеческих оценках — чтобы она отвечала на вопросы, а не
продолжала их новыми вопросами, как делал бы простой продолжатель текста.
Это дообучение меняет манеру, но не добавляет в модель справочник.
Контекстное окно — это рабочий стол#
Контекстное окно — предел текста, который модель способна учитывать за один
раз: системная инструкция, вся переписка, приложенные файлы и сам ответ.
Измеряется в токенах.
Сравнение простое: это не память, а стол. Пока лист лежит на столе, модель
его видит целиком. Когда стол переполняется, старые листы сбрасывают —
интерфейс обычно молча выкидывает начало разговора или пересказывает его
короче. Отсюда знакомое ощущение, что в долгой беседе модель «забыла»
уговор из первых сообщений: лист со стола убрали.
Прибавка внешних данных — тот самый RAG — работает через этот же стол.
Поисковая часть находит подходящие фрагменты документов и кладёт их в
запрос, модель отвечает по ним. Меняется содержимое стола, а не сама
модель.
Почему один и тот же вопрос даёт разные ответы#
На каждом шаге модель получает не один вариант продолжения, а распределение
вероятностей по всему словарю. Дальше из него выбирают. Температура —
настройка этого выбора: около нуля почти всегда берётся самый вероятный
токен, ответы становятся однообразными и предсказуемыми; выше — модель
чаще берёт варианты пореже, текст выходит живее и непредсказуемее.
Отсюда практическое: для извлечения данных, форматов и кода нужна низкая
температура, для вариантов заголовков — высокая. И отсюда же понятно,
почему «модель мне вчера отвечала иначе» — не поломка.
Пределы: что проверять всегда#
Выдумка неотличима по виду от правды. Ссылка, номер страницы, название
статьи, цитата, артикул, номер ГОСТа — всё это модель порождает тем же
способом, что и остальной текст, то есть по правдоподобию. Ссылки
открывай, цитаты ищи в источнике, числа сверяй.
Уверенность в тоне ничего не означает. Модель не располагает сведениями о
границах собственного незнания; оговорка «возможно» в ответе — такой же
подобранный по вероятности оборот, как любой другой.
Отправленное в чужой сервис тебе больше не принадлежит целиком. Переписка,
приложенные документы, фрагменты рабочего кода хранятся на стороне
владельца сервиса по его правилам.
Медицина, право, деньги — не её зона. Формулировка может быть гладкой и
похожей на консультацию, но ответственности за последствия не несёт никто.
Решение принимает специалист, у которого есть лицензия и доступ к твоей
конкретной ситуации.
Наконец, свойства конкретных продуктов — ChatGPT, Claude, Gigachat,
Алиса — меняются с каждым обновлением: длина окна, набор инструментов,
поведение. Сравнивать их по «уму» бессмысленно, проверять стоит на своей
задаче.
И отдельно: ответ модели не заменяет врача, юриста и финансового
консультанта. Там, где цена ошибки — здоровье, деньги или права,
решение принимает человек с ответственностью за него.
План по этапам
- Посмотреть на токенизациюОткрыть любой токенизатор и увидеть, как твой текст режется на куски и сколько их получается.
- Упереться в контекстДовести длинный диалог до момента, когда модель теряет ранние договорённости, — окно перестанет быть абстракцией.
- Поиграть температуройЗадать один вопрос при низкой и высокой температуре, сравнить разброс ответов.
- Проверить ссылки из ответаПопросить пять источников по узкой теме и открыть каждый: часть окажется несуществующей.
- Собрать своё правилоЗаписать, в каких задачах ты доверяешь ответу сразу, а в каких обязаны свериться.
Начать изучать эту тему у себя
План ляжет в твой репозиторий: отмечай этапы, веди конспект — история изменений покажет, как ты продвинулся.
Проверь себя
1.Что означает контекстное окно модели?
2.Температуру снизили почти до нуля. Что изменится?
3.Почему модель может выдать ссылку на несуществующую статью?
Источники
-
Large language model — WikipediaОбзор с терминами и ссылками на статьибесплатно
-
Документация AnthropicКонтекст, параметры запроса, работа с инструментамибесплатно
-
Документация OpenAIТокены, температура, форматы ответабесплатно
Было полезно?