Разработан новый линейный классификатор SEFR, выполненный полностью на SQL в Google BigQuery. Он демонстрирует AUC 0.954 для задачи обнаружения мошенничества на выборке в 55 тысяч случаев, что близко к 0.986 у логистической регрессии. Однако главной фишкой SEFR является скорость: он работает почти в 18 раз быстрее, благодаря тому, что не использует итеративную оптимизацию, а полностью параллелизируем.
Сравнение с существующими методами
Метод логистической регрессии давно используется в машинном обучении и является стандартом для многих задач. Однако его итеративный подход требует более значительных ресурсов, что делает его менее подходящим для больших данных или вычислительных ограничений. В отличие от этого, SEFR показывает, что можно достичь высоких результатов без необходимости в сложных алгоритмах оптимизации.
Классификатор SEFR может стать интересным инструментом для разработчиков и аналитиков данных, которым нужна высокая скорость обработки без потери точности. Поскольку многие компании работают с большими объёмами информации, использование подобных решений становится более актуальным.
Практические выводы для разработчиков
Новый классификатор может изменить подход к проектам, связанным с анализом больших данных. Для команд машинного обучения, работающих с SQL, вариант использования SEFR может значительно ускорить процессы аналитики и привести к ускорению разработки. Важно отметить, что быстрая реализация может также дать преимущество в бизнесе, где скорость реагирования на мошеннические действия имеет критическое значение.
Предварительные тесты показывают, что такой подход имеет потенциал для широкого распространения, особенно среди компаний, работающих в сегментах финансов и безопасности.