NVIDIA разработала FinHeadlineMix — набор из 502,5 тысячи уникальных заголовков финансовых новостей, что является значительным шагом вперёд в области AI-исследований. Этот проект поможет улучшить обучение моделей за счёт увеличения разнообразия данных в сравнении с реальными новостями, которые часто фокусируются на обычных событиях.
Проблема нехватки данных
Исследования в области финансового анализа сталкиваются с проблемой нехватки разнообразных и сбалансированных данных. Чаще всего реальных финансовых новостей достаточно, но они изобилуют событиями, связанными с прибылями и движением акций, в то время как редкие события, такие как изменения кредитного рейтинга и продукты, получают недостаточно освещения.
Для решения этой проблемы NVIDIA применяет синтетическую генерацию данных. С помощью инструментов NeMo Data Designer, NeMo Curator и моделей Nemotron, компания запускает итеративный цикл разработки, который приводит к созданию обширных наборов данных, включая 13 категорий заголовков финансовых новостей.
Детали генерации данных
Процесс генерации заголовков включает несколько этапов. На первом этапе были созданы 500 000 заголовков, из которых 65% пришлось удалить как дубликаты. После этих итераций итоговый набор данных достиг 502 536 уникальных заголовков.
Процесс использовал 82 итерации на 8-way NVIDIA B200 node и длился примерно 6 дней. Успех проекта обеспечен трижды: оптимизированные алгоритмы дедупликации, динамическое распределение категорий и выбор уникальных примеров передачал эффективность и разнообразие финального набора данных.
Практическое значение проекта
Для российских финансовых институтов этот проект открывает новые возможности в области анализа и машинного обучения. С активным использованием синтетических данных исследователи смогут улучшить свои модели и получить более точные результаты. Особенно это актуально для компаний, работающих над алгоритмами торговли и оценкой рисков.
Ближайшие шаги заключаются в интеграции созданных заголовков в различные модели AI и их тестировании в реальных сценариях, что позволит расширить возможности существующих моделей и улучшить их производительность.