Специалисты Центра языка и мозга НИУ ВШЭ создали RusLan-M — открытый мультимедийный корпус, позволяющий проследить развитие русской речи у детей от первых слов до сложных грамматических конструкций. Ресурс помогает уточнить механизмы освоения языка, но пока ограничен малой выборкой объектов наблюдения.
База данных основана на лонгитюдном анализе, при котором исследователи фиксировали речь двух детей (Тоси и Яши) в течение длительного времени. Речь Тоси записывали с 10 месяцев до 3 лет и 10 месяцев, Яши — с 1 года и 4 месяцев до 3 лет. В общей сложности в корпус вошли 288 видеозаписей общей продолжительностью около 41 часа, что позволило собрать 35 386 детских высказываний. Все данные прошли анонимизацию и транскрибированы в международном формате CHAT для публикации на платформе TalkBank.
В отличие от лабораторных тестов или опросов родителей, RusLan-M фиксирует спонтанное общение в естественной среде. Это позволяет анализировать не только сами слова, но и речевой контекст, в котором ребенок взаимодействует с близкими.
Биолог Андрей Ворошилов поясняет, что использование данных о спонтанной речи в естественной среде дает более полное представление о когнитивных процессах развития, чем изолированные эксперименты, так как учитывает влияние социального окружения на формирование языковых навыков.
Разработка призвана восполнить дефицит данных о русском языке в международной базе CHILDES, где славянские языки представлены слабо. В перспективе такие корпуса помогут создать нормативные ориентиры речевого развития, чтобы специалисты могли точнее отличать индивидуальный темп освоения языка от патологий.
Главным ограничением работы остается размер выборки: данные двух детей не позволяют сформулировать универсальные закономерности для всего русскоязычного населения. Для создания точных моделей освоения языка потребуется расширение коллекции за счет большего числа участников.