• ВХОД
  •  

    Полное описание

    Повышение эффективности фильтрации спама на основе методов машинного обучения в сообщениях различной природы / И. А. Чижова, Е. И. Кублик, М. С. Чипчагов, А. И. Лабинцев. - DOI 10.18127/j19998554-202205-01. - Текст : непосредственный // Нейрокомпьютеры: разработка, применение = Neurocomputers : международный научно-технический журнал. - 2022. - Том 24, N 5. - С. 5-18. - Библиогр. в конце ст. - ISSN 1999-8554.

    ГРНТИ УДК
    50.37.23004.056.5
    28.25.23004.85

    Рубрики:
    Информационная безопасность
    Машинное обучение

    Кл.слова (ненормированные): машинное обучение -- фильтрация спама -- классификация текстов -- спам
    Аннотация: В настоящее время общение и обмен информацией все чаще осуществляется в электронной форме. Однако основной проблемой так называемого электронного обмена является такое неэтичное использование информации, как анонимная и массовая рассылка контента (спама), который не запрашивался пользователем. Поэтому в связи с постоянным увеличением количества электронной информации фильтрация спама приобретает особое значение. Большинство существующих решений данной проблемы основано на одном из алгоритмов машинного обучения, что снижает точность обнаружения ненужного контента. Следовательно, актуальным является использование совокупности методов классификации сообщений, т.е. разделение на спам и не спам. Цель статьи - рассмотреть особенности классификации спама различного вида с целью повышения эффективности фильтрации спама на основе методов машинного обучения в сообщениях различной природы. Предложены модели, основанные на наборах данных, которые используются для идентификации SMS-спама, спама в письмах-email и страниц веб-спама в коммерческих и научных целях. Проведен предварительный анализ данных каждого из выбранных наборов данных и продемонстрированы основные способы применения методов машинного обучения. Выполнен анализ моделей с набором показателей, включающих в себя метрики accuracy, оценку F1, точность, полноту, площадь под ROC-кривой (ROC AUC) и среднюю абсолютную ошибку. На основе оценок рассматриваемых моделей выявлен наилучший метод для идентификации спама. Результаты проведенного исследования показали, что сравнительный анализ моделей классификации сообщений позволяет значительно улучшить обнаружение спама и достичь точности его обнаружения до 99% на заданных наборах данных.
    Доп. точки доступа:
    Чижова, И.А.
    Кублик, Е.И.
    Чипчагов, М.С.
    Лабинцев, А.И.

    Экз-ры полностью dc3ac58ffce36183903096af01144728/2022/24/5
    Нет сведений об экземплярах
    Держатели документа:
    Государственная публичная научно-техническая библиотека России : 123298, г. Москва, ул. 3-я Хорошевская, д. 17 (Шифр в БД-источнике (KATBW): -652861-593681)

    Шифр в сводном ЭК: 50135bf469d6c6cb8a22ceaf86425675




    Заказ фрагмента документа ₽