AI И НЕЙРОСЕТИ

NVIDIA разработала 502,5 тысячи уникальных заголовков для финансовых AI-исследований

NVIDIA представила FinHeadlineMix — 502536 уникальных финансовых заголовков для улучшения AI-исследований.

✍️ Редакция iTech News | 18.10.2025 | ⏱ 2 мин | Источник: NVIDIA Developer Blog
NVIDIA создала более полумиллиона заголовков для финансового AI

NVIDIA разработала FinHeadlineMix — набор из 502,5 тысячи уникальных заголовков финансовых новостей, что является значительным шагом вперёд в области AI-исследований. Этот проект поможет улучшить обучение моделей за счёт увеличения разнообразия данных в сравнении с реальными новостями, которые часто фокусируются на обычных событиях.

Проблема нехватки данных

Исследования в области финансового анализа сталкиваются с проблемой нехватки разнообразных и сбалансированных данных. Чаще всего реальных финансовых новостей достаточно, но они изобилуют событиями, связанными с прибылями и движением акций, в то время как редкие события, такие как изменения кредитного рейтинга и продукты, получают недостаточно освещения.

Для решения этой проблемы NVIDIA применяет синтетическую генерацию данных. С помощью инструментов NeMo Data Designer, NeMo Curator и моделей Nemotron, компания запускает итеративный цикл разработки, который приводит к созданию обширных наборов данных, включая 13 категорий заголовков финансовых новостей.

Детали генерации данных

Процесс генерации заголовков включает несколько этапов. На первом этапе были созданы 500 000 заголовков, из которых 65% пришлось удалить как дубликаты. После этих итераций итоговый набор данных достиг 502 536 уникальных заголовков.

Процесс использовал 82 итерации на 8-way NVIDIA B200 node и длился примерно 6 дней. Успех проекта обеспечен трижды: оптимизированные алгоритмы дедупликации, динамическое распределение категорий и выбор уникальных примеров передачал эффективность и разнообразие финального набора данных.

Практическое значение проекта

Для российских финансовых институтов этот проект открывает новые возможности в области анализа и машинного обучения. С активным использованием синтетических данных исследователи смогут улучшить свои модели и получить более точные результаты. Особенно это актуально для компаний, работающих над алгоритмами торговли и оценкой рисков.

Ближайшие шаги заключаются в интеграции созданных заголовков в различные модели AI и их тестировании в реальных сценариях, что позволит расширить возможности существующих моделей и улучшить их производительность.

Поделиться: Telegram X LinkedIn