Дети учат язык в сотни тысяч раз эффективнее ИИ: разрыв в данных остается загадкой

Дети учат язык в сотни тысяч раз эффективнее ИИ: разрыв в данных остается загадкой

Технологии

Автор материала

Илья Вересов

Путевой обозреватель, собирает практичные советы о дорогах, ночёвках и маршрутах выходного дня.

Современные большие языковые модели (LLM) требуют для обучения языку в сотни тысяч раз больше текста, чем ребенок слышит к своему первому дню рождения. Этот разрыв, называемый разрывом в эффективности данных, остается одной из главных загадок когнитивной науки и искусственного интеллекта.

По данным исследования, опубликованного MIT Technology Review 24 августа 2026 года, модель Llama 3.1 от Meta была предварительно обучена на 15 триллионах токенов. Для сравнения: ребенок из лингвистически богатой семьи к подростковому возрасту слышит около 100 миллионов слов. Если распечатать все слова, использованные для обучения современной LLM, стопка бумаги достигнет Международной космической станции. Стопка из 100 миллионов слов, которые слышит ребенок, составит всего 20 метров.

«Прогресс в LLM потрясающий, — говорит Майкл С. Франк, когнитивист из Стэнфордского университета. — Но нам все еще приходится сжигать лес и соскребать всю сумму человеческих знаний, чтобы воссоздать веху, которая происходит в наших гостиных в течение года».

Ученые пытаются понять, как дети достигают беглого владения языком после прослушивания всего 10–30 миллионов слов. Если обучить модель GPT-2 на 30 миллионах слов, она генерирует бессмыслицу, а не осмысленные предложения. Дети же к двум годам начинают строить грамматически правильные фразы.

Одна из гипотез, восходящая к лингвисту Ноаму Хомскому, предполагает, что дети рождаются с врожденным знанием грамматики. Альтернативная точка зрения, которую сейчас проверяют на LLM, заключается в том, что язык можно выучить исключительно на основе статистических закономерностей, если модель достаточно велика. Однако LLM, будучи «наивными машинами для распознавания паттернов», показывают, что для этого нужны колоссальные объемы данных.

Понимание того, как дети учат язык с минимальным количеством примеров, может помочь создать более эффективные ИИ-модели. Это особенно важно для обучения ИИ на видео, а также для создания чат-ботов, обслуживающих сообщества, говорящие на языках с ограниченными данными. Кроме того, это может пролить свет на фундаментальные вопросы о природе человеческого разума: есть ли у нас врожденный языковой инстинкт или язык — это просто продукт опыта?

По оценкам ученых, запасы легко доступных интернет-данных для обучения ИИ могут иссякнуть уже к 2030-м годам. Поэтому понимание механизмов детского обучения становится не только научной, но и практической задачей для будущего искусственного интеллекта.

Последние новости и статьи