• A
  • A
  • A
  • АБВ
  • АБВ
  • АБВ
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта

Ученые представили новый метод для работы с несбалансированными данными

Ученые представили новый метод для работы с несбалансированными данными

© iStock

Специалисты факультета компьютерных наук НИУ ВШЭ и Лаборатории искусственного интеллекта Сбера разработали геометрический метод расширения данных — Simplicial SMOTE. Тесты на разных наборах данных показали, что он значительно улучшает качество работы AI. Метод особенно полезен в ситуациях, когда редкие случаи очень важны, например в борьбе с мошенничеством или при диагностике редких болезней. Результаты исследования доступны в открытом архиве Arxiv.org и будут представлены на Международной конференции по обнаружению знаний и анализу данных (KDD) летом 2025 года в Торонто.

Проблема несбалансированных данных становится все более актуальной в различных областях, в том числе в банковском секторе и медицине. Традиционные методы — случайное дублирование или глобальное семплирование — часто дают низкокачественную выборку или плохо моделируют данные редких классов.

Предложенный учеными из НИУ ВШЭ и Сбера новый метод — Simplicial SMOTE (Synthetic Minority Oversampling Technique) — решает эти проблемы: обеспечивает более точное моделирование сложных топологических структур данных и увеличивает качество классификаторов на несбалансированных наборах данных.

Он помогает создавать новые примеры редкого класса, используя информацию из нескольких близких примеров («симплекса»), а не только из двух близких точек, как в исходной версии SMOTE и его известных аналогах. Это позволяет лучше понимать данные и улучшать работу AI. Метод помогает усовершенствовать обучение искусственного интеллекта на несбалансированных данных, то есть в таких ситуациях,  когда есть много примеров одного класса (например, нормальных транзакций), но мало примеров другого (например, мошенничества).

Исследователи экспериментально показали на большом количестве тестовых датасетов, что предложенный подход значимо повышает метрики качества (F1-мера, коэффициент корреляции Matthews) как базового SMOTE, так и его модификаций. В том числе зафиксировано улучшение и для градиентного бустинга — часто используемого на практике классификатора.

Андрей Савченко

«Наш метод особенно эффективен в задачах, где распространены несбалансированные данные и где редкий класс более значим. Банки могут использовать Simplicial SMOTE, чтобы лучше выявлять мошенничество, а медицинские центры — чтобы диагностировать редкие заболевания», — комментирует один из авторов статьи Андрей Савченко, ведущий научный сотрудник Лаборатории теоретических основ моделей искусственного интеллекта Института искусственного интеллекта и цифровых наук ФКН НИУ ВШЭ.

Новый метод можно интегрировать в существующие алгоритмы оверсемплинга (Borderline-SMOTE, Safe-level-SMOTE и ADASYN), повысив их точность без существенного роста вычислительной сложности. Исследователи считают, что разработанный подход может способствовать развитию более точных и надежных моделей машинного обучения и, следовательно, повышению качества аналитики.

Исследование выполнено при поддержке Программы фундаментальных исследований НИУ ВШЭ.

Вам также может быть интересно:

В НИУ ВШЭ пройдет международная конференция об обучении служением и искусственном интеллекте

21–23 октября 2026 года в НИУ ВШЭ пройдет Международная научно-практическая конференция «Обучение служением и искусственный интеллект: человекоцентричная социальная миссия университета». Конференция объединит представителей российских и зарубежных университетов, органов власти, некоммерческих организаций и бизнеса. Регистрация уже открыта.

Исследователи НИУ ВШЭ оценили вклад стран БРИКС в ведущие конференции по машинному обучению

Наукометрический центр НИУ ВШЭ проанализировал более 104 тысяч работ за 2020–2025 годы, которые были представлены на десяти конференциях высшего уровня A* по рейтингу ICORE 2026. Исследователи изучили вклад Бразилии, России, Индии, Китая и ЮАР: на эти страны пришлось около 40,8 тысячи публикаций — 39,2% от всего массива. Однако распределение крайне неравномерно, и единого исследовательского пространства БРИКС пока нет.

Лаборатория будущих сетей: в НИИТ ВШЭ создали стенд для исследований 5G/6G

Стенд 5G/6G в НИИТ ВШЭ становится исследовательской площадкой, образовательной лабораторией и основой для разработки новых программных компонентов сетей будущего. Он позволяет не просто наблюдать за работой мобильной сети, а менять условия ее работы и измерять результат: скорость передачи данных, задержки, ошибки, использование радиоресурсов и другие параметры. На его основе исследователи планируют развивать технологии MIMO, O-RAN, xApp и IAB, а также экспериментировать с искусственным интеллектом.

Ученые НИУ ВШЭ научили нейросеть превращать 3D-модели в готовые технологические карты

Исследователи Института искусственного интеллекта и цифровых наук ФКН НИУ ВШЭ разработали систему CAD2TechSpec, которая автоматически превращает 3D-модели деталей в готовые технологические карты — пошаговые инструкции для станков. Разработка направлена на сокращение времени подготовки технической документации в машиностроении, авиастроении и других высокотехнологичных отраслях. Результаты исследованияо публикованы в журнале PeerJ Computer Science.

В НИУ ВШЭ запущен реестр ИИ-сервисов и моделей

Институт искусственного интеллекта и цифровых наук ФКН разработал сервис для регистрации и учета достижений в области искусственного интеллекта (ИИ). Платформа уже доступна для сотрудников и студентов университета.

Исследователи НИУ ВШЭ и Сбера научили нейросети лучше угадывать предпочтения пользователей

Институт искусственного интеллекта и цифровых наук ФКН НИУ ВШЭ и Сбер представили новую архитектуру для рекомендательных систем: благодаря объединению двух классов моделей алгоритмы лучше угадывают интересы и потребности пользователей. Препринт работы опубликован на сайте arxiv.org и представлен на летнем фестивале «Урбан ML».

Аналитика начинается с практики: хакатоны DANO пройдут в четырех городах России

Национальная олимпиада по анализу данных DANO начинается с серии хакатонов, которые пройдут в сентябре — октябре в четырех российских городах. За два дня участники попробуют себя в роли аналитиков: будут работать с реальными данными, искать закономерности, проверять гипотезы, принимать решения в команде и защищать свои проекты перед экспертами.

Исследователи ВШЭ показали, как создавать регуляторную ДНК напрямую

Исследователи НИУ ВШЭ разработали модель для генерации промоторов и энхансеров — участков ДНК, регулирующих работу генов. Модель работает с нуклеотидами ДНК напрямую, без промежуточного преобразования в непрерывное числовое пространство. Разработка может быть полезна в синтетической биологии и генной терапии. Результаты исследования представлены на воркшопе конференции ICLR 2026.

ФКН ВШЭ и ЧГУ реализовали три отраслевых образовательных модуля по искусственному интеллекту

В 2025/26 учебном году факультет компьютерных наук (ФКН) ВШЭ совместно с Череповецким государственным университетом реализовал три отраслевых образовательных модуля по искусственному интеллекту. Инициатива была представлена в рамках проекта «Топ-ИИ» Минцифры России при участии АНО «Аналитический центр при Правительстве Российской Федерации». Эксперты НИУ ВШЭ совместно с индустриальными партнерами разработали линейку отраслевых образовательных модулей в области искусственного интеллекта.

ИИ для врачей: ФКН ВШЭ провел курс для студентов Российского университета медицины

В июне завершился курс, посвященный использованию искусственного интеллекта в медицине, который факультет компьютерных наук НИУ ВШЭ провел для студентов первого курса направления «Педиатрия» Российского университета медицины. Курс реализован при поддержке гранта, полученного НИУ ВШЭ в соответствии с мероприятиями федерального проекта «Искусственный интеллект» национального проекта «Экономика данных и цифровая трансформация государства».