• ВХОД
  •  

    Полное описание


    Старков, Игорь Игоревич. Применение методов машинного обучения в системах выявления плагиата с целью решения проблемы узкоспециализированных понятий = Application of machine learning methods in plagiarism detection systems in order to solve the problem of highly specialized concepts / И. И. Старков, А. И. Власов. - Текст : непосредственный // Наукоемкие технологии = Science Intensive Technologies : международный научно-технический журнал, освещающий новые наукоемкие технологии в радиоэлектронике, микро- и наноэлектронике; рассматривающий вопросы междисциплинарных исследований когнитивных процессов и экономические аспекты. - 2023. - Т. 24, N 1. - С. 69-76. - Библиогр. в конце ст. - ISSN 1999-8465.
    (Шифр в БД У2528/2023/24/1)
    ГРНТИ УДК
    28.23.25004.85-049.8
    10.41347.77
    34:004.8
    РУБ ИИ
    04.07
    07.01

    Рубрики:
    Машинное обучение -- Применение
    Авторское право
    Искусственный интеллект -- Применение в юриспруденции

    Кл.слова (ненормированные): оценка качества классификации -- метрики качества -- модель классификации -- модель машинного обучения -- алгоритм шинглов -- антиплагиат -- плагиат
    Аннотация: Как известно, в системах выявления плагиата для определения уникальности текста часто используется алгоритм шинглов. Данный алгоритм не может определить контекст и тему исследуемого материала для того, чтобы исключить из проверки те слова, которые характерны для данной тематической области. Это может привести к ситуации, когда человек понимает, что уникальность статьи выше необходимого порога, а алгоритм, поскольку работа изобилует одинаковыми словами (терминами), посчитает её недостаточно уникальной. Поэтому необходимо применение методов машинного обучения в системах выявления плагиата с целью решения проблемы узкоспециализированных понятий. Цель исследования - построить модель машинного обучения, определяющей характерные слова для выбранной тематической области, которые будут удаляться из статьи, и уже обработанный текст будет поступать на вход алгоритма шинглов. Описаны проблемы идентификации плагиата с позиции узкоспециализированных текстов. Приведен краткий обзор существующих систем по выявлению плагиата с отражением их сильных и слабых сторон. Рассмотрен алгоритм шинглов, предназначенный для обнаружения плагиата в текстовых работах. Разработана классификационная модель машинного обучения, которая будет определять, к какой теме относится статья, исходя из ее названия, чтобы в дальнейшем составить список слов, чаще всего встречающихся в статьях данной темы (не считая предлогов, союзов и т.п.). Приведены результаты работы данной модели, отраженные в соответствующих метриках качества моделей классификации. Даны рекомендации по улучшению разработанной модели. Внедрение описанной модели машинного обучения в современные онлайн-сервисы, специализирующиеся на проверке текста на заимствования, уменьшит количество случаев, когда при проверке узкоспециализированных материалов у проверяемой работы оказывается низкая уникальность из-за использования узкоспециализированных терминов. При этом не придется тратить время на подбор синонимов к таким терминам там, где это не имеет смысла. Следовательно, к подобным сервисам возрастет пользовательский интерес.
    Доп. точки доступа:
    Власов, Андрей Игоревич

    Экз-ры полностью У2528/2023/24/1
    Имеются экземпляры в отделах: всего 2 : ЧЗХР (1), ХРЦ (1)
    Свободны: ЧЗХР (1), ХРЦ (1)



    Заказ фрагмента документа ₽