
Дети учат язык на крохе данных, которые нужны языковым моделям, и причина неясна
Малыши обычно начинают строить грамматически правильные предложения, услышав примерно от 10 до 30 миллионов слов. Большим языковым моделям для беглого и гибкого владения языком нужны триллионы токенов — разрыв, который исследователи называют разрывом в эффективности данных, сообщил MIT Technology Review.
Llama 3.1 от Meta прошла предобучение на 15 триллионах токенов два года назад, а сегодняшние передовые модели могут обучаться на данных в 10 раз больше, по словам когнитивиста из Джорджтауна Итана Готлиба Уилкокса. Ребёнок дошкольного возраста из семьи с богатой языковой средой слышит примерно 100 миллионов слов — цифра, которая вырастает примерно до 300 миллионов к 20 годам с учётом чтения. Уилкокс сформулировал масштаб разрыва так: современная LLM увидела столько языка, сколько целый город производит за одно поколение.
“Прогресс в последнее время впечатляет. Но нам всё ещё приходится сжигать лес и наскребать всю сумму человеческих знаний, чтобы воссоздать веху, которая в наших гостиных случается за год.”
— Майкл С. Фрэнк, когнитивист, Стэнфордский университет
Сокращение разрыва важно не только из любопытства. Легко доступный пул текстов из интернета может иссякнуть уже в 2030-х годах, и исследователи видят в более эффективном по данным подходе к обучению один из способов, которым передовые лаборатории смогут продолжать масштабировать модели, когда этот источник оскудеет. Смежную грань того же давления мы разбирали в материале про дата-центр OpenAI на $30 млрд в Джорджии. Там дефицит вычислительных мощностей меняет то, как лаборатории планируют мощности, наравне с вопросом данных.
Исследователи Алекс Уорстадт, Лешем Хошен и коллеги запустили в 2022 году ежегодный конкурс BabyLM, чтобы проверить эту идею напрямую. Участники обучают модели на корпусе в 100 миллионов слов, собранном из детских книг, диалогов, субтитров и записей речи, обращённой к детям, а затем оценивают их по тем же грамматическим тестам, что используют психолингвисты с людьми. Победитель 2024 года, модель GPT-BERT, обучалась на примерно 100 миллионах слов и всё равно превзошла Llama 2 70B от Meta, обученную на данных примерно в 15 000 раз больше, в одном из тестов конкурса.
- Малыши достигают беглой грамматики примерно после 10-30 млн слов воздействия
- Llama 3.1 от Meta прошла предобучение на 15 трлн токенов в 2024 году
- Победитель BabyLM 2024 года GPT-BERT обучался на примерно 100 млн слов
- GPT-BERT превзошёл Llama 2 70B, обученную на данных в ~15 000 раз больше, в одном тесте
- Легко доступные данные для обучения из интернета могут иссякнуть уже в 2030-х
Отдельное направление исследований пытается сократить разрыв, изучая, как дети на самом деле воспринимают мир, а не только текст. Майкл Фрэнк из Стэнфорда провёл проект SAYCam, в рамках которого с помощью нательных камер записывали по два часа в неделю жизни трёх младенцев в возрасте от шести месяцев до двух с половиной лет. Нейробиолог из Принстона Ури Хассон пошёл дальше, записывая по 12 часов в день первые 1000 дней жизни 17 детей для проекта, описанного в препринте 2026 года. Ни один из этих наборов данных пока не дал модель, которая осваивает язык так же, как реальный малыш.
Психолог развития из Беркли Элисон Гопник указывает на вероятную причину: дети активно исследуют и экспериментируют со своим окружением, а не пассивно поглощают видео или текст, помещённый перед ними. Исследователи Meta проявили интерес к теме, участвуя в мультимодальном направлении BabyLM и недавно анонсировав бенчмарк для обучения моделей на записях с нательных камер младенцев, но ни одна лаборатория пока не разгадала, как воспроизвести любопытство малыша внутри конвейера обучения.
Это не финансовый совет — только информация к размышлению.

Комментарии (0)
Пока нет комментариев — будь первым!
Похожие материалы

Лучший август биткоина с 2017 года проходит проверку Джексон-Хоулом

Nvidia ведёт переговоры об инвестициях в Perplexity по оценке $30 млрд+

Fasset стал стейблкоин-единорогом после раунда на $68 млн от SBI Group
ПопулярноеТоп 7
Крипторынок теряет 4-5% за день: что говорят объёмы и трейдеры
72Рынок


