НЕЙРОМЕРЕЖЕВИЙ МЕТОД РОЗПІЗНАВАННЯ ЕМОЦІЙНОГО СТАНУ МОВЛЕННЯ В СИСТЕМАХ КОНТАКТ-ЦЕНТРІВ НА ОСНОВІ АРХІТЕКТУРИ CNN-BiLSTM З МОДИФІКОВАНИМ МЕХАНІЗМОМ УВАГИ
Ключові слова
Анотація
Актуальність дослідження зумовлена необхідністю підвищення ефективності систем підтримки прийняття рішень у контакт-центрах для автоматизованого аналізу емоційного стану мовлення операторів і клієнтів. Визначення емоційної напруженості у голосі дозволяє своєчасно коригувати взаємодію, підвищувати якість обслуговування та ефективність роботи операторів. Традиційні методи обробки аудіосигналів, що базуються на мел-частотних кепстральних коефіцієнтах (MFCC), мають обмеження щодо збереження повної акустичної інформації, що знижує точність розпізнавання емоцій. У роботі запропоновано нейромережевий метод, який поєднує згорткові нейронні мережі (CNN) та двонаправлені мережі довгострокової короткочасної пам’яті (BiLSTM) з модифікованим механізмом уваги (Attention). Першим етапом здійснено завантаження українськомовного аудіонабору та попередню обробку даних, що включає нормалізацію амплітуди, фільтрацію шумів, сегментацію мовлення, перетворення у мел-спектрограму та вилучення низькорівневих дескрипторів (LLD), таких як енергія і частота основного тону. Вхідні дані формуються у тензори фіксованої розмірності для нейромережевого аналізу. На етапі вилучення ознак CNN автоматично визначає локальні спектральні характеристики сигналу, включно з інтенсивністю, частотними компонентами та інтонаційними сплесками. Кожен згортковий блок доповнено пакетною нормалізацією для стабільного навчання та пришвидшення збіжності. Для моделювання часової динаміки емоційного стану застосовано двонапрямлені шари BiLSTM, що враховують контекст попередніх і наступних фрагментів сигналу. Механізм уваги формує контекстний вектор як зважену суму ознак, визначаючи відносну значущість окремих часових кадрів, який передається до повнозв’язного шару з функцією активації tanh. Модифікований механізм уваги у цій роботі означає інтеграцію метаданих аудіозапису (тривалість сигналу, бітрейт 640 кбіт/с, технічні ідентифікатори) у процес формування контекстного вектору через систему мультимодального зважування (MWS). Це дозволяє одночасно враховувати локальні спектральні ознаки, часову динаміку аудіосигналу та релевантність окремих фрагментів мовлення. Наукова новизна полягає у розробленні нейромережевого методу, що поєднує CNN–BiLSTM–Attention з механізмом мультимодального зважування, який інтегрує метадані аудіозапису у формування контекстного вектора. Така архітектура забезпечує підвищену точність розпізнавання емоційної напруженості. Проведено порівняльний аналіз традиційних MFCC та LLD, який показав перевагу LLD: базова точність CNN зросла з 82,42 % до 91,00 %, а інтеграція шару Attention додатково підвищила точність на 1,5...2 %. Найвищий результат 93,48 % досягнуто у разі поєднання CNN-BiLSTM-Attention з багатомодальною системою зважування та ознаками LLD.
