РАЗРАБОТКА

GitHub запустил открытый набор данных для многиязычной AI-демократии

GitHub представил новый набор данных для разработки многиязычного ИИ. Это облегчает поиск и анализ репозиториев.

✍️ Редакция iTech News | 11.11.2025 | ⏱ 2 мин | Источник: GitHub Blog
GitHub выпустил набор данных для многиязычного AI

GitHub запустил набор данных для разработки многиязычных AI-решений, что значительно упростит исследователям и разработчикам работу с репозиториями на различных языках. Этот шаг стал важным вкладом в поддержку межъязыкового сотрудничества в разработке ПО.

Почему многиязычность важна для разработчиков

Разработчики всё чаще работают в международной среде, где помощь и коды обсуждаются не только на английском. Данные GitHub показывают, что корейский язык преобладает в текстах issues, однако португальский — лидер среди README, насчитывая более 3 миллионов репозиториев.

Новый набор данных GitHub охватывает более 80 миллионов классификаций из более чем 40 миллионов публичных репозиториев, предоставляя возможность исследовать, как разные языковые сообщества используют системы отслеживания ошибок и обсуждения кода. Это позволит разработчикам и исследователям глубже понять и улучшить многиязычное взаимодействие в сообществе.

Содержание нового набора данных

Набор не содержит полный текст репозиториев, а сосредоточен на метаданных, включая языковые классификации README, самых обсуждаемых issues и pull requests. Классификации выполняются с использованием технологий, таких как fastText и gcld3, и рекомендуется использовать данные с уверенностью более 0,5.

Если вам нужна высокая точность для определённых языков, такие как греческий, можно применять строгие критерии. Если же вы изучаете романские языки, возможно, одного классификатора будет достаточно.

Преимущества для разработчиков

Новый набор данных поможет разработчикам находить репозитории с документацией или сотрудничеством на специфических языках. Это открывает горизонты для создания AI-инструментов, которые могут работать с многими языками, а также выявляет недостаток представительства европейских и других менее распространенных языков в open source.

При этом важно понимать, что определение языка в текстах репозиториев не всегда легко, поэтому набор предназначен для помощи в исследованиях, а не как единственно верный эталон идентификации языков.

В качестве предстоящего шага GitHub планирует продолжать развитие этого инструмента и улучшение доступности многиязычных данных для AI-разработчиков.

Поделиться: Telegram X LinkedIn