AI И НЕЙРОСЕТИ

«Т-Технологии» свели к общему знаменателю дообучение LLM

5–10% данных для SFT дают до 95% результата: исследователи «Т-Технологий» показали, как честно сравнивать методы дообучения LLM.

✍️ Редакция iTech News | 11.07.2026 | ⏱ 5 мин | Источник: CNews
🎯

Исследователи группы «Т-Технологии» предложили единый способ сравнивать дообучение LLM и заодно показали неприятную для части модных подходов вещь: во многих случаях решает не громкое название алгоритма, а куда более приземленный выбор схемы ранжирования ответов. Для российских команд, которые строят прикладных ассистентов, это новость не академическая: она бьет и по качеству модели, и по бюджету экспериментов.

По данным CNews, работу выполнила лаборатория научных исследований группы «Т-Технологии». Команда сопоставила несколько методов прямого выравнивания больших языковых моделей, которые обучаются на заранее размеченных предпочтениях между ответами. В центре сравнения оказались подходы DPO, ORPO, SimPO, IPO и ASFT, а ключевой вопрос звучал просто: что сильнее влияет на итоговое качество — сам алгоритм или способ, которым модель учат различать хороший и плохой ответ.

Ответ получился довольно практичный. Лучше показали себя методы, где модель сразу видит два ответа на один запрос и учится поднимать более удачный выше слабого. Такой попарный подход оказался устойчивее, чем поточечный сценарий, где хороший и плохой ответы оцениваются по отдельности. На бумаге разница выглядит как нюанс формулировки функции потерь. На практике это означает, будет ли модель лучше следовать инструкциям, аккуратнее пересказывать текст и увереннее справляться с задачами средней сложности, где от нее ждут не угадайку, а внятный выбор между несколькими правдоподобными вариантами.

Чтобы сравнение не превращалось в соревнование «у кого удобнее настроен пайплайн», исследователи привели методы к общим условиям. Одноэтапные ORPO и ASFT они перевели в двухэтапный режим: сначала supervised fine-tuning на качественных примерах, затем отдельная стадия выравнивания по человеческим предпочтениям. Кроме того, в ORPO и ASFT добавили параметр β, которого там раньше не было. Этот коэффициент регулирует, насколько сильно модель должна менять поведение при обучении на предпочтениях. Важный момент: добавление β не ослабило методы, а, наоборот, подняло их метрики. На Reddit TL;DR прирост составил 7 процентных пунктов по GPT-4 Win Rate для ORPO и сразу 43 пункта для ASFT. На связке Llama 3.1 8B с датасетами UltraChat и UltraFeedback прибавка достигла 3,5 и 8,3 пункта по AlpacaEval 2 LC WR соответственно.

Набор экспериментов был не игрушечный. В работе использовали Llama 3.2 3B, Llama 3.1 8B, Mistral 7B, Qwen 2.5 7B и Qwen 2.5 14B. Модели обучали на Reddit TL;DR, UltraChat и UltraFeedback, а качество проверяли на AlpacaEval 2, ArenaHard, математических бенчмарках и через попарные сравнения ответов более сильной моделью. Это не снимает всех вопросов к универсальности выводов, но сильно снижает риск того, что результат держится на одном удачном датасете или на единственной архитектуре. Иными словами, история не про «мы тонко подкрутили один рецепт и получили магию», а про попытку привести зоопарк методов дообучения LLM к общему знаменателю.

Один из самых полезных выводов для прикладных команд связан не с качеством, а со стоимостью итераций. Для первой стадии обучения, supervised fine-tuning, часто не нужен полный объем данных. По оценке исследователей, уже 5–10% датасета позволяют получить не менее 95% результата от варианта с полным набором. Для компании это звучит почти как редкий подарок от науки: гипотезы можно проверять быстрее, а входной билет в эксперимент ниже. Не обязательно сразу собирать и размечать весь корпус, если задача — понять, работает ли сама идея. Особенно это важно там, где разметка дорогая: в доменных чат-ассистентах, суммаризации документов, генерации кода и задачах, где ошибка модели потом возвращается в виде ручной доработки команды.

Почему поточечные методы проигрывают? Исследователи объясняют это их чувствительностью к смещениям, завязанным на конкретные промпты. Пока модель отдельно «хвалит» хороший ответ и отдельно «ругает» плохой, часть вычислительного ресурса уходит на разбор локальных перекосов, а не на явное различение качества двух кандидатов. В попарном варианте сигнал чище: есть два ответа, нужно понять, какой лучше. Почти школьная логика, только без родительского чата. При этом на слишком простых задачах разница сглаживается. Например, на кратком пересказе Reddit TL;DR почти все методы перевалили за 90% по GPT-4 Win Rate. На очень сложных задачах отрыв тоже уменьшается. Самая заметная польза от попарного обучения проявляется как раз в средней зоне сложности, где и живет большинство реальных продуктовых сценариев.

Для рынка это важный сдвиг оптики. Последние пару лет область выравнивания языковых моделей обрастала новыми аббревиатурами с такой скоростью, будто индустрия решила соревноваться не только в качестве, но и в плотности нейминга. Почти каждый новый метод заявлялся как шаг вперед относительно предыдущего. Работа «Т-Технологий» подталкивает к менее романтичному и более инженерному выводу: часть преимуществ исчезает, если сравнивать подходы в одинаковых условиях. Для ML-команд это хороший повод внимательнее смотреть не на бренд алгоритма, а на конструкцию эксперимента, объем SFT, наличие управляемого параметра вроде β и тип сигнала предпочтений.

Руководитель лаборатории фундаментальных исследований ИИ группы «Т-Технологии» Даниил Гаврилов сформулировал вывод еще проще: модели легче понять, что такое хороший ответ, когда ей сразу показывают два варианта и просят выбрать лучший. Следующий шаг команды — проверить, сохраняется ли этот эффект в более сложных сценариях, где модель сама генерирует ответы и получает по ним обратную связь. Если вывод подтвердится и там, рынок получит не просто аккуратное сравнение нескольких техник, а довольно неприятный для хайпа тезис: в дообучении LLM побеждает не самый шумный алгоритм, а тот, который дает модели более внятный сигнал выбора.

Поделиться: Telegram X LinkedIn