БАГАТОМОВНА КЛАСИФІКАЦІЯ ЕЛЕКТРОННИХ ЛИСТІВ В УМОВАХ ДИСБАЛАНСУ КЛАСІВ ДЛЯ МАРШРУТИЗАЦІЇ В РЕКТОРАТІ УНІВЕРСИТЕТУ
Ключові слова
Анотація
Розглянуто проблему ручного сортування електронних листів у ректораті місцевого університету. Багато електронних листів, що надходять до секретаріату ректора, потребують ручного перегляду та подальшого перенаправлення до інших підрозділів університету. У такому випадку листи не оброблялися безспосередньо секретаріатом, їх потрібно переслати до семи різних підрозділів-адресатів. Проаналізовано електронні листи, призначені для відділів освіти (education), якості освіти (education quality), навчальної роботи та розвитку студентського потенціалу (education outreach), міжнародної діяльності (international office), науки (science), господарського відділу (utility) та проректора (vice rector). Початкова база даних електронних листів містила 9842 листи. Після видалення дублікатів залишилося 8153 унікальних листів. Використання алгоритму, що поєднував видалення дублікатів з пошуком подібних листів, дало 4672 унікальних записів. Лише 477 з цих потенційних записів можна вважати достатньо маркованими для навчання моделей з учителем. До трьох сімейств моделей, що досліджувалися, належать: TF-IDF з використанням логістичної регресії, TF-IDF з використанням лінійної машини опорних векторів (SVM) та XLM-RoBERTa. Найкращі результати показало поєднання TF-IDF з SVM. Поєднання TF-IDF та SVM перевершило TF-IDF з логістичною регресією за показником F-measure (макро f1: 0,6421, зважений f1: 0,7920 та точність: 0,8021) за випадкового поділу та показником F-measure (макро f1: 0,5371, зважений f1: 0,6854 та точність: 0,6947) з хронологічним розбиттям. Аналіз класів продемонстрував чудові результати для найпоширеніших класів з високою частотою, таких як “science” та "education". Проте результати для класів з нижчою частотою виявились мінливими. Повнота (recall) для "education outreach" — нульова для обох поділів через наявність лише одного тестового запису. З 102 загальних помилок, допущених у обох комбінаціях TF-IDF, усі, крім однієї, відбулися нижче рівня достовірності 0,5. Отже, загалом ця стаття визначає автоматичне пересилання листів для ректорату університету як завдання багатомовної класифікації з екстремальним дисбалансом класів. Відсутність достатньої кількості мічених даних та обмежені лексичні моделі є найбільшою перешкодою для впровадження рішення для цієї задачі.
