• ВХОД
  •  

    Полное описание

    Нейросетевой метод визуального распознавания голосовых команд водителя с использованием механизма внимания = Neural network-based method for visual recognition of driver’s voice commands using attention mechanism / Александр Александрович Аксёнов, Елена Витальевна Рюмина, Дмитрий Александрович Рюмин [и др.]. - DOI 10.17586/2226-1494-2023-23-4-767-775. - Текст : непосредственный // Научно-технический вестник информационных технологий, механики и оптики = Scientific and Technical Journal of Information Technologies, Mechanics and Optics. - 2023. - Том 23, N 4. - С. 767-775. - Библиогр. в конце ст. - ISSN 2226-1494.

    ГРНТИ УДК
    28.23.37004.032.26
    28.23.25004.855.5
    16.31.21004.934.2

    Рубрики:
    Нейронные сети -- Применение
    Машинное обучение -- Применение
    Речевые сигналы -- Распознавание

    Кл.слова (ненормированные): механизм внимания -- голосовые команды водителя -- визуальное распознавание речи -- автоматическое чтение речи по губам -- машинное обучение -- CNN -- LSTM
    Аннотация: Визуальное распознавание речи или автоматическое чтение речи по губам все чаще применяется для преобразования речи в текст. Видеоданные доказывают свою необходимость в системах мультимодального распознавания речи, особенно когда использование акустических данных затруднено в виду сильных аудиошумов или недоступно. Основная цель исследования заключается в повышении эффективности распознавания команд водителя путем анализа визуальной информации для снижения тактильного взаимодействия с различными автомобильными системами (мультимедийными и навигационными, телефонными звонками и др.) во время вождения. Предложен метод автоматического чтения речи водителя по губам в процессе управления транспортным средством на основе глубокой нейронной сети архитектуры 3DResNet18. Выполнен анализ динамической информации о движении губ диктора с помощью 3D-сверточных слоев нейросети. Использование нейросетевой архитектуры с двунаправленной моделью Long Short-Term Memory и механизмом внимания позволяет добиться более высокой точности распознавания при незначительном снижении скорости работы. Предложены и исследованы два варианта нейросетевых архитектур для визуального распознавания речи. При использовании первой нейросетевой архитектуры результат распознавания голосовых команд водителя составил 77,68 %, что ниже на 5,78 %, по сравнению со второй. Скорость работы системы определена показателем реального времени (Real-Time Factor, RTF), значение которого для первой нейросетевой архитектуры равен 0,076, а второй - 0,183, что выше более чем в два раза. Предложенный метод апробирован на данных дикторов многомодального корпуса RUSAVIC, записанных в автомобиле. Результаты исследования могут найти применение в системах аудиовизуального распознавания речи. Подобные системы могут быть рекомендованы для применения в сильно зашумленных условиях, например, в процессе управления транспортным средством. Проведенный анализ позволил выбрать оптимальную нейросетевую модель визуального распознавания речи для последующего встраивания в ассистивную систему на базе мобильного устройства.
    Доп. точки доступа:
    Аксёнов, Александр Александрович
    Рюмина, Елена Витальевна
    Рюмин, Дмитрий Александрович
    Иванько, Денис Викторович
    Карпов, Алексей Анатольевич

    Экз-ры полностью 643d3722bf972ba380146151b4ff554a/2023/23/4
    Нет сведений об экземплярах
    Держатели документа:
    Государственная публичная научно-техническая библиотека России : 123298, г. Москва, ул. 3-я Хорошевская, д. 17 (Шифр в БД-источнике (KATBW): -624221-005391)

    Шифр в сводном ЭК: bb8a790aebd3ccf9f3a5616319372c49




    Заказ фрагмента документа ₽