языковые модели
«Т-Технологии» свели к общему знаменателю дообучение LLM
5–10% данных для SFT дают до 95% результата: исследователи «Т-Технологий» показали, как честно сравнивать методы дообучения LLM.

NVIDIA улучшила генерацию Bash-команд у небольших языковых моделей на 13%
NVIDIA довела успех генерации Bash-команд до 75,2% у небольших языковых моделей благодаря ограниченному декодированию.

Исследование: «Тёплые» AI-модели чаще ошибаются на 60%
Новые AI-модели с тёплым подходом к пользователям на 60% чаще дают неправильные ответы, согласно исследованию Оксфордского университета.

Cloudflare увеличил скорость работы моделей Kimi K2.5 в 3 раза
Cloudflare улучшил производительность языковых моделей Kimi K2.5, сделав их в 3 раза быстрее. Это важно для разработчиков AI-решений.
Новые данные: токенизация без потерь не приводит к избыточности
Исследование подтверждает, что токенизация без потерь не вводит избыточность и может улучшить работу языковых моделей.
Большие языковые модели теряют специализацию ради универсальности
Разработчики фронтирных языковых моделей жертвуют узкоспециализированными функциями ради общих способностей к рассуждению и программированию.

Anthropic исследовал влияние эмоций на поведение LLM — результаты неожиданные
Исследование Anthropic показало, как эмоции влияют на поведение больших языковых моделей. Узнайте, что это значит для разработчиков.

Anthropic открыла новый подход к анализу моделей языка — J-lens
Anthropic разработала J-lens для изучения скрытых процессов в языковых моделях. Это может изменить подход к машинному обучению.

OpenAI запустил GPT-Red — супер-хакера для защиты LLM
OpenAI создал GPT-Red — LLM-супер-хакера для защиты своих моделей. Это ключевой шаг в повышении безопаснсти.