Система Sonar-MASt3R, созданная MIT и Woods Hole Oceanographic Institution, прошла испытания на восьми уровнях мутности воды и смогла строить 3D-карту сцены даже там, где обычная камера уже почти бесполезна. Для подводного картографирования это важный сдвиг: роботу больше не нужно просто зависать и ждать, пока осядет поднятый со дна ил. Для разработчиков автономных систем и industrial CV это еще и наглядный кейс о том, как правильно склеивать слабые сигналы из разных сенсоров, а не пытаться выжать чудо из одной только оптики.
О работе Эми Фанг и ее научного руководителя Ричарда Камилли сообщает MIT Technology Review. Их идея довольно прагматична: сначала аппарат быстро «прощупывает» окружение сонаром, который не страдает от взвеси так, как камера, а затем подходит ближе к нужному объекту и уточняет картину оптическими данными. В такой связке сонар не пытается изображать из себя полноценную камеру, а камера перестает притворяться, что способна работать в облаке осадка. На выходе получается система, которая помогает безопасно подвести аппарат к цели и уже потом разбираться с деталями.
Ключевой технический ход в том, что команда не ограничилась простой параллельной работой двух сенсоров. Исследователи взяли MASt3R, алгоритм сопоставления изображений, разработанный французской группой, и использовали его для быстрой оценки относительной глубины каждого пикселя в 2D-сцене. У таких методов есть старая проблема: они понимают, что один объект ближе другого, но не всегда знают масштаб в физических единицах. Сонар как раз закрывает этот провал, потому что дает абсолютные измерения расстояния и формы. По сути, Sonar-MASt3R использует акустику, чтобы «заземлить» визуальную реконструкцию в реальном пространстве.
Испытывали систему не в красивом рендере и не на синтетике, а в резервуаре с водой, осадком и набором предметов, среди которых были небольшой валун, кружка и ящик. На роботизированную руку установили подводную камеру и сонар, после чего проводили проходы вдоль резервуара, собирая данные. Сначала формировалась грубая карта по акустике, затем она дополнялась близкими визуальными кадрами. Чтобы все не утонуло в вычислительной цене, команда использовала подход с keyframe: если новый кадр не приносит полезной информации по сравнению с предыдущим ключевым, его сразу выбрасывают. Для real-time-систем это не косметика, а вопрос выживания: без агрессивной фильтрации данных никакого оперативного подводного картографирования не получится.
Самый интересный результат в том, что система смогла различать детали сантиметрового масштаба и работала в более мутных условиях, чем другие подходы к opti-acoustic fusion, с которыми ее сравнивали исследователи. В наиболее тяжелом сценарии камера не могла нормально видеть объекты за взвесью, но сонар все равно строил грубую карту. Этого было достаточно, чтобы роботизированная рука безопасно подвела сенсоры ближе к цели, после чего оптика уже добирала недостающие детали. То есть речь не о магическом «зрении сквозь грязь», а о грамотной двухэтапной навигации: сначала не врезаться, потом распознать.
Практический список применений у работы тоже вполне земной, без академической поэзии. Камилли прямо говорит про операции с неразорвавшимися подводными минами: в таких задачах плохая видимость сама по себе становится фактором риска, и именно поэтому туда логично отправлять робототехнику. Кроме того, технология годится для научных экспедиций, подводного строительства, инспекции и обслуживания инфраструктуры, а также для deep-sea recovery. Если перевести это на язык бизнеса, то ценность не только в том, что робот «видит лучше», а в том, что окно для операций становится шире: не нужно так жестко зависеть от прозрачности воды и пауз между подъемом осадка.
Для IT-аудитории здесь есть несколько полезных выводов. Первый: сенсорный fusion по-прежнему выигрывает у попыток найти один идеальный датчик на все случаи жизни. Второй: алгоритмическая эффективность важна не меньше качества модели. История с keyframe-подходом показывает, что победа часто приходит не от самой сложной нейросети, а от удачной инженерной композиции из готовых компонентов. Третий: хорошая робототехника все чаще выглядит как дисциплина на стыке computer vision, signal processing и системной оптимизации. Иными словами, тот, кто умеет аккуратно собирать пайплайн из несовершенных модулей, получает больше, чем тот, кто просто наращивает вычисления.
Сейчас команда собирается тестировать метод уже в естественной среде, а не в резервуаре, где акустика ведет себя почти как в комнате с кривыми зеркалами: много отражений, ревербераций и ложных сигналов. Парадоксально, но в реальном море задачу может оказаться решать проще, чем в лабораторной емкости. Если это подтвердится, подводное картографирование получит не очередной красивый прототип, а вполне рабочий шаблон для систем, которым нужно действовать в плохой видимости без права на лишний удар о грунт, кабель или старую мину.