СТРАТЕГІЯ, ЗМІСТ ТА НОВІ ТЕХНОЛОГІЇ ПІДГОТОВКИ ФАХІВЦІВ У СФЕРАХ КОМП’ЮТЕРНИХ НАУК, ІНФОРМАЦІЙНИХ ТЕХНОЛОГІЙ, ЕЛЕКТРОНІКИ ТА АВТОМАТИЗАЦІЇ

БАГАТОМОВНА КЛАСИФІКАЦІЯ ЕЛЕКТРОННИХ ЛИСТІВ В УМОВАХ ДИСБАЛАНСУ КЛАСІВ ДЛЯ МАРШРУТИЗАЦІЇ В РЕКТОРАТІ УНІВЕРСИТЕТУ

Автор(и)

Г. Є. Брусенцов ORCID 0000-0002-3346-0164
Національний університет «Львівська політехніка» ROR
DOI https://doi.org/10.31649/

Ключові слова

багатомовна класифікація електронної пошти дисбаланс класів напівкероване навчання TF-IDF лінійна SVM

Анотація

Розглянуто проблему ручного сортування електронних листів у ректораті місцевого університету. Багато електронних листів, що надходять до секретаріату ректора, потребують ручного перегляду та подальшого перенаправлення до інших підрозділів університету. У такому випадку листи не оброблялися безспосередньо секретаріатом, їх потрібно переслати до семи різних підрозділів-адресатів. Проаналізовано електронні листи, призначені для відділів освіти (education), якості освіти (education quality), навчальної роботи та розвитку студентського потенціалу (education outreach), міжнародної діяльності (international office), науки (science), господарського відділу (utility) та проректора (vice rector). Початкова база даних електронних листів містила 9842 листи. Після видалення дублікатів залишилося 8153 унікальних листів. Використання алгоритму, що поєднував видалення дублікатів з пошуком подібних листів, дало 4672 унікальних записів. Лише 477 з цих потенційних записів можна вважати достатньо маркованими для навчання моделей з учителем. До трьох сімейств моделей, що досліджувалися, належать: TF-IDF з використанням логістичної регресії, TF-IDF з використанням лінійної машини опорних векторів (SVM) та XLM-RoBERTa. Найкращі результати показало поєднання TF-IDF з SVM. Поєднання TF-IDF та SVM перевершило TF-IDF з логістичною регресією за показником F-measure (макро f1: 0,6421, зважений f1: 0,7920 та точність: 0,8021) за випадкового поділу та показником F-measure (макро f1: 0,5371, зважений f1: 0,6854 та точність: 0,6947) з хронологічним розбиттям. Аналіз класів продемонстрував чудові результати для найпоширеніших класів з високою частотою, таких як “science” та "education". Проте результати для класів з нижчою частотою виявились мінливими. Повнота (recall) для "education outreach" — нульова для обох поділів через наявність лише одного тестового запису. З 102 загальних помилок, допущених у обох комбінаціях TF-IDF, усі, крім однієї, відбулися нижче рівня достовірності 0,5. Отже, загалом ця стаття визначає автоматичне пересилання листів для ректорату університету як завдання багатомовної класифікації з екстремальним дисбалансом класів. Відсутність достатньої кількості мічених даних та обмежені лексичні моделі є найбільшою перешкодою для впровадження рішення для цієї задачі.

0 0

Як цитувати

[1]
«БАГАТОМОВНА КЛАСИФІКАЦІЯ ЕЛЕКТРОННИХ ЛИСТІВ В УМОВАХ ДИСБАЛАНСУ КЛАСІВ ДЛЯ МАРШРУТИЗАЦІЇ В РЕКТОРАТІ УНІВЕРСИТЕТУ», Вісник ВПІ, вип. 4, с. 211–217, Вер 2026, doi: 10.31649/.

Біографія автора

автор Г. Є. Брусенцов, афіліація Національний університет «Львівська політехніка»

аспірант кафедри систем штучного інтелекту

Посилання

[1] S. Scerri, G. Gossen, B. Davis, and S. Handschuh, “Classifying Action Items for Semantic Email,” in Proceedings of the Seventh International Conference on Language Resources and Evaluation (LREC’10), Valletta, Malta, 2010. [Online]. Available: https://aclanthology.org/L10-1018/ .
[2] B. Sandrih Todorovic, K. Josipovic, and J. Kodre, “Three Approaches to Client Email Topic Classification,” in Proceedings of the 14th International Conference on Recent Advances in Natural Language Processing, Varna, Bulgaria, 2023, pp. 1015-1022. [Online]. Available: https://aclanthology.org/2023.ranlp-1.109/ .
[3] M. Marcuzzo, A. Zangari, M. Schiavinato, L. Giudice, A. Gasparetto, and A. Albarelli, “A multi-level approach for hierarchical Ticket Classification,” in Proceedings of the Eighth Workshop on Noisy User-generated Text (W-NUT 2022), Gyeongju, Republic of Korea, 2022, pp. 201-214. [Online]. Available: https://aclanthology.org/2022.wnut-1.22/ .
[4] J. Wang, and C. D. Manning, “Baselines and Bigrams: Simple, Good Sentiment and Topic Classification,” in Proceedings of the 50th Annual Meeting of the Association for Computational Linguistics (ACL), Jeju, Republic of Korea, 2012, pp. 90-94. [Online]. Available: https://aclanthology.org/P12-2018/ .
[5] A. Conneau, et al., “Unsupervised Cross-lingual Representation Learning at Scale,” in Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics (ACL), 2020, pp. 8440-8451. [Online]. Available: https://aclanthology.org/2020.acl-main.747/ .
[6] H. He, and E. A. Garcia, “Learning from Imbalanced Data,” IEEE Transactions on Knowledge and Data Engineering, vol. 21, no. 9, pp. 1263-1284, Sep. 2009, https://doi.org/10.1109/TKDE.2008.239 .
[7] G. Salton, A. Wong, and C. S. Yang, “A Vector Space Model for Automatic Indexing,” Communications of the ACM, vol. 18, no. 11, pp. 613-620, Nov. 1975, https://doi.org/10.1145/361219.361220 .