LLM (большая языковая модель)
LLM — нейросеть, обученная на огромных объёмах текста и предсказывающая следующий фрагмент слова. Из этого простого механизма и вырастает всё остальное: ответы на вопросы, перевод, код, рассуждения.
Как это работает
Модель не хранит текст и не ищет по базе. Она хранит веса — миллиарды чисел, настроенных так, чтобы по началу фразы предсказывать её продолжение. Ответ строится по одному токену за раз, и каждый следующий выбирается с учётом всех предыдущих.
Обучение идёт в два больших этапа. Сначала предобучение на массиве текста — так модель усваивает язык и фактические связи. Затем дообучение на примерах желаемого поведения и обратной связи от людей — так она учится отвечать полезно, а не просто правдоподобно продолжать.
Отсюда главное практическое следствие: модель не «знает» в человеческом смысле, а воспроизводит закономерности. Уверенный тон в ответе не связан с тем, верен ли ответ.
Что модель делает хорошо и плохо
- Хорошо: работа с данным текстомПересказ, перевод, поиск противоречий, переписывание в другом стиле. Материал перед глазами, придумывать нечего.
- Хорошо: структурирование и черновикиРазложить задачу, предложить план, набросать код — там, где важна форма, а проверка остаётся за вами.
- Плохо: точные факты по памятиДаты, цифры, цитаты и ссылки модель воспроизводит правдоподобно, но не гарантированно верно. Всё это проверяется отдельно.
- Плохо: арифметика и свежие событияСчёт по шагам даётся моделям тяжелее, чем текст, а знания заканчиваются на дате обучения, если нет доступа к поиску.