У одной из версий GeForce RTX 5070 Ti температура hotspot под нагрузкой доходила до 107 °C, хотя обычные утилиты показывали вполне безобидные 67–68 °C. Разница оказалась не в «кривом софте», а в том, что Nvidia скрыла этот датчик в потребительской линейке Blackwell, и без него пользователь видит не реальное тепловое состояние карты, а усредненную картинку. Для разработчиков, студий и IT-команд, которые закупают рабочие станции и GPU-парки, это плохая новость: карта может терять частоты и ресурс, пока мониторинг уверяет, что все нормально.
История всплыла после разбора бразильского ремонтного специалиста Паулу Гомеса, о котором сообщает Tom's Hardware. К нему попала Gigabyte GeForce RTX 5070 Ti с жалобой на перегрев. В Windows типовые инструменты мониторинга не показывали ничего драматичного: температура GPU держалась в районе 67–68 °C. Но при проверке через MODS, внутренний диагностический пакет Nvidia, скрытый датчик температуры hotspot почти сразу показал 107 °C под нагрузкой. На этом значении карта начала сбрасывать частоты, то есть ушла в классический thermal throttling, защищая себя от перегрева.
Самое интересное здесь не то, что у конкретной карты оказался плохой теплоконтакт. Такое на рынке бывает. Интереснее другое: аппаратный датчик никуда не делся. Nvidia просто убрала его из обычной телеметрии для GeForce RTX 50-й серии. Раньше обозреватели заметили, что HWiNFO, MSI Afterburner и другие популярные инструменты больше не могут читать hotspot у новых Blackwell. Теперь выяснилось, что ограничение программное и касается публичного доступа, а не самого железа. Если у сервиса или мастерской есть MODS, датчик читается.
MODS расшифровывается как Modular Diagnostics Software. Это не пользовательская утилита, а внутренний набор инструментов Nvidia для тестирования видеокарт до выхода в продажу и во время RMA-процедур. По данным источника, он не рассчитан на работу в Windows, потому что ОС перехватывает обращения к аппаратным API мониторинга. Для нормального запуска нужен Linux-дистрибутив, загружающийся сразу в командную строку; там же обычно используют MATS для проверки памяти. Проще говоря, получить картину, которую сама Nvidia видит при сервисной диагностике, обычный владелец GeForce не может. А значит, не может и быстро доказать, что у него не «капризная игра», не плохая вентиляция корпуса и не выдуманная проблема, а локальный перегрев конкретного участка кристалла или подложки.
После разборки карты причина оказалась довольно приземленной: неудачное нанесение TIM, то есть термоинтерфейсного материала. Паста скопилась по периметру кристалла, а центр в основном остался сухим. Ремонтники заменили материал на SnowDog Husky, и этого хватило, чтобы снизить температуру hotspot до 100 °C. Это все еще много, но уже ниже порога, на котором карта начинала душить собственные частоты. Иными словами, проблема не требовала сложной пайки, замены памяти или экзотической диагностики. По сути, перед нами кейс, где скрытая телеметрия превратила сравнительно прямой ремонт в более долгий и дорогой поиск неисправности.
Контекст у этой истории тоже неприятный. Tom's Hardware напоминает о прошлогоднем исследовании Igor's Lab, где у нескольких видеокарт RTX 50-й серии нашли системную проблему с hotspot. Тогда речь шла о свойствах PCB и тепловом поведении отдельных зон платы: определенные участки нагревались сильнее, чем можно было предположить по средней температуре GPU. Ситуацию, по версии лаборатории, усугубляли рекомендации Nvidia для партнеров AIB, которые ориентировались скорее на идеальные условия, чем на худший сценарий. Если соединить тот фон с нынешним кейсом, получается картина, от которой производителям и ритейлу должно быть неуютно: чувствительный для ресурса параметр существует, сервис его видит, а клиент — нет.
Для российского рынка и вообще для B2B-покупателей железа здесь есть вполне практический вывод. Если видеокарта идет не в домашний ПК, а в рабочую станцию для рендера, ML-экспериментов, компиляции тяжелых проектов, VDI или просто в парк машин разработчиков, «средняя температура чипа» уже нельзя считать достаточным показателем здоровья. При длительной нагрузке важна именно температура hotspot, потому что она показывает локальные тепловые пики, а не комфортную цифру для скриншота в мониторинге. Если ее не видно, команда эксплуатации теряет важный сигнал: почему под одинаковой нагрузкой одна карта держит частоты, а другая тихо скатывается в деградацию производительности. Для интеграторов это еще и риск лишних обращений в сервис, затянутой диагностики и споров по гарантии, когда формально «ничего не перегревается».
Есть и управленческий слой проблемы. Nvidia давно продает не просто GPU, а платформу с сильным контролем над экосистемой: драйверы, диагностика, телеметрия, сервисные сценарии. Для серверных и профессиональных карт компания оставляет более полные средства мониторинга, а в геймерском сегменте, похоже, решила закрыть часть данных от пользователя. Формально это можно объяснить чем угодно — от снижения числа ложных тревог до желания не путать массового покупателя. Но на практике скрытая температура hotspot делает рынок менее прозрачным. Если карта упирается в 107 °C и режет частоты, пользователю важно знать именно это, а не любоваться аккуратными 68 °C в оверлее.
Теперь главный вопрос не в том, существует ли датчик, а в том, почему доступ к нему решили оставить только для внутренней кухни. После истории с RTX 5070 Ti спор о телеметрии перестает быть темой для энтузиастских форумов: это уже вопрос качества диагностики, предсказуемости производительности и доверия к метрикам, которые показывает сама платформа. Если у Blackwell действительно есть склонность к локальным перегревам, рынок рано или поздно потребует не красивых средних значений, а полного набора температурных данных, без которых любая «нормальная температура GPU» выглядит скорее как удобная версия правды.