КОМП’ЮТЕРНІ НАУКИ, ШТУЧНИЙ ІНТЕЛЕКТ ТА СИСТЕМНИЙ АНАЛІЗ

МЕТОД ТА ЗАСІБ АНАЛІЗУ ЕФЕКТИВНОСТІ РОБОТИ ВЕЛИКИХ МОВНИХ МОДЕЛЕЙ ДЛЯ ВИКОНАННЯ ЗАДАЧ КОМПЛЕКСНОГО ХАРАКТЕРУ

Автор(и)

Є. М. Крижановський ORCID 0000-0003-1311-1175
Вінницький національний технічний університет ROR
І. М. Штельмах ORCID 0009-0008-1259-448X
Вінницький національний технічний університет ROR
М. В. Швець ORCID 0009-0005-0933-2938
Вінницький національний технічний університет ROR
О. О. Войцеховська ORCID 0000-0001-8504-1204
Вінницький національний технічний університет ROR

Ключові слова

великі мовні моделі комплексні задач оцінка ефективності багатокритеріальний підхід інтеграція даних автоматизація

Анотація

Проаналізовано сучасні підходи до оцінки ефективності великих мовних моделей для виконання комплексних задач, які включають одночасний аналіз нормативно-правових документів та числових даних. Розглянуто проблеми інтеграції різнорідної інформації, забезпечення логічної узгодженості результатів та порівняння моделей за різними критеріями: коректністю, стабільністю, часом обробки та дотриманням інструкцій. Актуальність дослідження зумовлена швидким розвитком великих мовних моделей та необхідністю вибору оптимальних рішень для задач прикладного характеру, де помилки можуть мати суттєві наслідки.

Основу методу становить багатокритеріальний підхід, який передбачає одночасний аналіз результатів моделей на комплексному запиті: обробка нормативних документів та CSV-даних із середньодобовими концентраціями забруднювачів повітря. Для оцінки результатів використано показники коректності, стабільності, часу виконання, вартості, використання токенів та дотримання інструкцій.

Запропоновано математичну модель агрегування результатів, що включає усереднення показників по множині тестових задач, виділення множини Парето-оптимальних моделей, побудову скаляризованої функції корисності для визначення оптимальної конфігурації моделі залежно від заданих вагових коефіцієнтів.

Апробація методу на прикладі міста Вінниця показала, що різні моделі мають суттєві відмінності у здатності формувати узгоджені висновки. На основі аналізу моделями нормативних порогів визначено оптимальну кількість пунктів спостереження для різних забруднювачів, що забезпечує репрезентативний моніторинг якості повітря. Запропонований підхід дозволяє враховувати специфіку комплексних прикладних задач, інтегрувати різнорідні дані та підвищує обґрунтованість вибору моделей для практичного застосування.

Встановлено, що моделі класу GPT-4o та GPT-5.1 забезпечують кращий баланс між коректністю та стабільністю з прийнятним рівнем ресурсних витрат. На прикладному рівні отримано обґрунтовані рекомендації щодо кількості пунктів спостереження атмосферного повітря для міста Вінниця, що підтверджує здатність моделей інтегрувати нормативні вимоги та числові дані. Показано, що коректність таких рішень істотно залежить не лише від якості моделі, але й від її стабільності та здатності дотримуватись інструкцій.

2 0

Як цитувати

[1]
«МЕТОД ТА ЗАСІБ АНАЛІЗУ ЕФЕКТИВНОСТІ РОБОТИ ВЕЛИКИХ МОВНИХ МОДЕЛЕЙ ДЛЯ ВИКОНАННЯ ЗАДАЧ КОМПЛЕКСНОГО ХАРАКТЕРУ», Вісник ВПІ, вип. 4, с. 97–107, Жов 2026, doi: 10.31649/1997-9266-2026-187-4-97-107.

Біографії авторів

автор Є. М. Крижановський , афіліація Вінницький національний технічний університет

 канд. техн. наук, доцент, доцент кафедри системного аналізу та інформаційних технологій

автор І. М. Штельмах, афіліація Вінницький національний технічний університет

канд. техн. наук, асистент кафедри системного аналізу та інформаційних технологій

автор М. В. Швець, афіліація Вінницький національний технічний університет

аспірант кафедри системного аналізу та інформаційних технологій

автор О. О. Войцеховська, афіліація Вінницький національний технічний університет

д-р філософії, доцент кафедри системного аналізу та інформаційних технологій

Посилання

[1] S. M. Sajjadi Mohammadabadi, et al., “A Survey of Large Language Models: Evolution, Architectures, Adaptation, Benchmarking, Applications, Challenges, and Societal Implications,” Electronics, vol. 14, no. 18: 3580, 2025. https://doi.org/10.3390/electronics14183580 .
[2] А. В. Лосенко, Є. М. Крижановський, І. М. Штельмах, і І. В. Варчук, «Технологія LLM-видобування ознак тестування пацієнтів з текстових звітів для удосконалення прогнозування кількості хворих на коронавірус,» Вісник Вінницького політехнічного інституту, № 6, с. 135-144. 2024. https://doi.org/10.31649/1997-9266-2024-177-6-135-144 .
[3] Є. М. Крижановський, В. О. Караваєв, І. М. Штельмах, і О. О. Войцеховська, «Автоматизація використання природномовних запитів для комплексного аналізу стану поверхневих вод басейну Південного Бугу,» Вісник Вінницького політехнічного інституту, № 4, с. 118-125. 2025. https://doi.org/10.31649/1997-9266-2025-181-4-118-125 .
[4] X. Han et al., “Pre-Trained Models: Past, Present and Future,” AI Open, vol. 2, pp. 225-250, 2021. https://doi.org/10.1016/j.aiopen.2021.08.002 .
[5] Q. He et al., “Can Large Language Models Understand Real-World Complex Instructions?” in Proceedings of the AAAI Conference on Artificial Intelligence, vol. 38, no. 16, pp. 18188-18196, 2024. https://doi.org/10.1609/aaai.v38i16.29777 .
[6] K. Papineni, S. Roukos, T. Ward, and W-J. Zhu, “BLEU: a method for automatic evaluation of machine translation,” in Proceedings of the 40th Annual Meeting on Association for Computational Linguistics (ACL ‘02), Philadelphia, Pennsylvania, USA, July 7—12, 2002, pp. 311-318. https://doi.org/10.3115/1073083.1073135 .
[7] C-Y. Lin, and F. J. Och, “Automatic evaluation of machine translation quality using longest common subsequence and skip-bigram statistics,” in Proceedings of the 42nd Annual Meeting on Association for Computational Linguistics (ACL ‘04), Barcelona, Spain, July 21-26, 2004, p. 605. https://doi.org/10.3115/1218955.1219032 .
[8] T. Sellam, D. Das, and A. Parikh, “BLEURT: Learning Robust Metrics for Text Generation,” in Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, Stroudsburg, PA, USA, July, 2020, pp. 7881-7892. https://aclanthology.org/2020.acl-main.704 .
[9] R. Bommasani, P. Liang, and T. Lee, “Holistic Evaluation of Language Models,” Annals of the New York Academy of Sciences, vol. 1525, pp. 140-146, 2023. https://doi.org/10.1111/nyas.15007 .
[10] Y. Liu, et al., “Datasets for large language models: a comprehensive survey,” Artificial Intelligence Review, vol. 58, article 403, 2025. https://doi.org/10.1007/s10462-025-11403-7 .
[11] W. Cao, et al., “Benchmarking large language models against human experts in rehabilitation medicine: a multidimensional evaluation,” Journal of NeuroEngineering and Rehabilitation, vol. 23, article 84, 2026. https://doi.org/10.1186/s12984-026-01903-0 .
[12] H. V. Pandhare, “Evaluating Large Language Models: Frameworks and Methodologies for AI/ML System Testing,” International Journal of Scientific Research and Management (IJSRM), vol. 12, issue 09, pp. 1467-1486. https://doi.org/10.18535/ijsrm/v12i09.ec08 .
[13] Є. М. Крижановський, і М. В. Швець, «Підхід до збору та візуалізації даних державного моніторингу стану атмосферного повітря міста Вінниці,» Матеріали LV Всеукраїнської науково-технічної конференції підрозділів ВНТУ, Вінниця, 24-27 березня 2026. [Електронний ресурс]. Режим доступу: https://conferences.vntu.edu.ua/index.php/all-fksa/all-fksa-2026/paper/view/27366
[14] LLM Comparator. [Online]. Available: https://llmcomparator.flitsolutions.com/ . Accessed: April 06, 2026.
[15] T. L. Saaty, “A scaling method for priorities in hierarchical structures,” Journal of Mathematical Psychology, vol. 15, no. 3, pp. 234-281, 1977. https://doi.org/10.1016/0022-2496(77)90033-5 .
[16] C.-L. Hwang, and K. Yoon, Multiple Attribute Decision Making: Methods and Applications. Berlin, Heidelberg: Springer, 1981. https://doi.org/10.1007/978-3-642-48318-9 .
[17] S. Opricovic, and G.-H. Tzeng, “Compromise solution by MCDM methods: A comparative analysis of VIKOR and TOPSIS,” European Journal of Operational Research, vol. 156, no. 2, pp. 445-455, 2004. https://doi.org/10.1016/S0377-2217(03)00020-1 .
[18] B. Roy, “Classement et choix en présence de points de vue multiples,” RAIRO – Revue d’automatique, d’informatique et de recherche opérationnelle, vol. 2, no. 1, pp. 57-75, 1968. https://doi.org/10.1051/ro/196802V100571 .
[19] Постанова Кабінету Міністрів України «Деякі питання здійснення державного моніторингу в галузі охорони атмосферного повітря» від 14.08.2019 р. № 827 зі змінами від 7.05. 2024 р. [Електронний ресурс]. Режим доступу: https://zakon.rada.gov.ua/laws/show/827-2019-%D0%BF#Text . Дата звернення: 06.04.2026.
[20] Наказ Міністерства внутрішніх справ України від 21.04.2021 № 300 «Про затвердження Порядку розміщення пунктів спостережень за забрудненням атмосферного повітря в зонах та агломераціях» [Електронний ресурс]. Режим доступу: https://zakon.rada.gov.ua/laws/show/z0635-21#Text . Дата звернення: 06.04.2026.

Статті цього автора (цих авторів), які найбільше читають

<< < 1 2 3 4 > >>