• ВХОД
  •  

    Полное описание


    Качанов, Юрий Александрович. Распределенный алгоритм извлечения текстовой информации из новостных сайтов с использованием технологий больших данных / Ю. А. Качанов, П. Д. Кравченя, М. А. Кузнецов, А. С. Кузнецова, В. В. Гилка. - DOI 10.21869/2223-1536-2021-11-4-8-25. - Текст : непосредственный // Юго-Западный государственный университет. Известия Юго-Западного государственного университета = Proceedings of the SOUTH-WEST STATE UNIVERSITY. Management, computer facilities, Computer science. Medical instrument making : научный рецензируемый журнал. - 2021. - Т. 11, N 4. - С. 8-25. - Библиогр. в конце ст. - ISSN 2223-1536.
    (Шифр в БД У4122/2021/11/4)
    ГРНТИ УДК
    28.23.37004.032.26

    Рубрики:
    Искусственный интеллект
    Нейронные сети -- Обработка
    Интернет -- Веб-сайты -- Обработка данных

    Кл.слова (ненормированные): большие данные -- apache spark -- google bert -- резюмирование текста -- обработка веб-страниц -- нейронные сети
    Аннотация: Целью данной работы является разработка алгоритма и программной системы, позволяющей выполнять в распределенном режиме извлечение информации из новостных сайтов с использованием технологий больших данных. Извлечение ключевых концепций содержания новостных сайтов помогает алгоритмам искусственного интеллекта исследовать экономические, политические и социальные явления в различных контекстах. Эта задача близка к проблеме реферирования текста, которая активно изучается в современных исследованиях. Но значительно меньше работ затрагивают алгоритмы больших данных для реферирования текста. Предложен новый алгоритм для эффективного извлечения текстовых значений из большого количества новостных сайтов, основанный на платформе больших данных Apache Spark. Смысл новостей анализируется с помощью Google BERT - современной архитектуры нейронной сети для обработки естественного языка. Различные группы новостей отделяются друг от друга с помощью алгоритма кластеризации k-средних. Количество кластеров определяется автоматически с использованием метода статистики разрыва. Содержимое сайтов извлекается с помощью браузеров Chrome, управляемых Selenium WebDriver в распределенном режиме. В статье приведены подробные алгоритмы реализованной программной системы, такие как математическая модель, архитектура программной распределенной системы. Оценка представленного алгоритма с помощью метрики ROUGE демонстрирует удовлетворительное качество резюмирования новостных текстов.
    Доп. точки доступа:
    Кравченя, Павел Дмитриевич
    Кузнецов, Михаил Андреевич
    Кузнецова, Агнесса Сергеевна
    Гилка, Вадим Викторович

    Экз-ры полностью У4122/2021/11/4
    Имеются экземпляры в отделах: всего 2 : ЧЗХР (1), ХРЦ (1)
    Свободны: ЧЗХР (1)
    Экз.2 (ХРЦ) занят;
    Переход по DOI



    Заказ фрагмента документа ₽