Статья ByteDance Seed исследует, как часто высококачественные доменные данные следует повторять при масштабировании LLM

ByteDance

исследования офиц. + СМИ 1 ист. ~1 мин

Команда ByteDance Seed опубликовала работу Scaling Domain Data Repetition in LLM Pretraining (arXiv 2608.14071, отправка на HF paper-page 17 августа, листинг arXiv 14 августа). При фиксированном количестве токенов на параметр оптимальное число повторений слегка увеличивается с размером модели; оптимальное повторение сильно отрицательно коррелирует с валидационными потерями по доменам; значения, подобранные на меньших прокси-моделях с тем же TPP, переносятся на более крупные модели.

Почему это важно

Конкретное переносимое правило для настройки того, как часто повторять дефицитные высококачественные доменные данные по мере роста LLM — напрямую применимо для обучения доменно-специализированных моделей на небольших корпусах, поскольку рецепт масштабируется без перенастройки поиска.

Важность: 3/5

open-weights / GA marker

Источники