КОМП’ЮТЕРНА ІНЖЕНЕРІЯ, ІНФОРМАЦІЙНІ СИСТЕМИ ТА ТЕХНОЛОГІЇ

ІНТЕЛЕКТУАЛЬНА СИСТЕМА ВИЗНАЧЕННЯ СЕМАНТИЧНОЇ УЗГОДЖЕНОСТІ РОЗПОДІЛЕНИХ ІНФОРМАЦІЙНИХ РЕСУРСІВ

Автор(и)

Ю. М. Геряк ORCID 0009-0008-3251-2007
Національний університет «Львівська політехніка» ROR
А. Ю. Берко ORCID 0000-0003-2892-9519
Національний університет «Львівська політехніка» ROR

Ключові слова

розподілені інформаційні ресурси якість даних семантична узгодженість інтелектуальна система гібридний підхід векторні представлення валідація даних інтеграція даних

Анотація

Розглянуто проблему оцінювання якості розподілених інформаційних ресурсів у контексті зростання обсягів, різнорідності та динаміки даних, що циркулюють у сучасних інформаційних системах. Показано, що для розподілених середовищ традиційних підходів до контролю якості даних, які базуються переважно на точності, повноті та узгодженості, уже недостатньо, оскільки вони не враховують семантичну неоднорідність, контекст використання, реплікацію, варіативність представлення сутностей та відмінності у правилах інтерпретації даних. Особливу увагу приділено семантичній узгодженості як ключовій характеристиці, від якої залежить коректність інтеграції даних, достовірність аналітичних висновків і якість автоматизованих рішень у гетерогенних середовищах.

Розроблено інтелектуальну систему визначення семантичної узгодженості розподілених інформаційних ресурсів, побудовану на гібридному підході, що поєднує синтаксичні метрики швидкого відсіву та глибокий семантичний аналіз на основі векторних представлень. Така архітектура дає змогу ефективно працювати як з очевидно узгодженими парами даних, так і зі складними випадками, де однаковий зміст подано різними лексичними засобами, скороченнями або доменними синонімами. Додатково реалізовано адаптивне порогове прийняття рішень, що дозволяє налаштовувати суворість перевірки залежно від типу атрибута та предметної області застосування, а також формувати інтегральний індекс семантичної узгодженості для подальшого моніторингу якості даних.

Експериментальна перевірка підтвердила доцільність впровадженого підходу для підвищення точності виявлення семантично еквівалентних, але формально різних записів. Отримані результати показали, що поєднання синтаксичних і семантичних методів дає змогу суттєво зменшити кількість хибних відмов і помилкових збігів у процесі порівняння атрибутів, а також створює методологічне підґрунтя для побудови масштабованих систем контролю якості розподілених інформаційних ресурсів. Практичне значення роботи полягає в можливості інтеграції розробленої системи до платформ моніторингу, валідації та керування якістю даних у фінансових, медичних, наукових та інших гетерогенних інформаційних середовищах

11 0

Як цитувати

[1]
«ІНТЕЛЕКТУАЛЬНА СИСТЕМА ВИЗНАЧЕННЯ СЕМАНТИЧНОЇ УЗГОДЖЕНОСТІ РОЗПОДІЛЕНИХ ІНФОРМАЦІЙНИХ РЕСУРСІВ», Вісник ВПІ, вип. 4, с. 24–33, Вер 2026, doi: 10.31649/1997-9266-2026-187-4-24-33.

Біографії авторів

автор Ю. М. Геряк, афіліація Національний університет «Львівська політехніка»

аспірант кафедри інформаційних систем та мереж

автор А. Ю. Берко , афіліація Національний університет «Львівська політехніка»

д-р техн. наук, професор кафедри інформаційних систем та мереж

Посилання

[1] L. Cai and Y. Zhu, “The challenges of data quality and data quality assessment in the big data era,” Data Science Journal, vol. 14, p. 2, 2015. https://doi.org/10.5334/dsj-2015-002 .
[2] J. Declerck, et al., “Assessing data quality in heterogeneous healthcare integration: The AIDAVA framework (preprint),” JMIR Medical Informatics, 2025. https://doi.org/10.2196/75275 .
[3] Ю. М. Геряк, i А. Ю. Берко, «Система критеріїв оцінки якості даних в розподілених інформаційних системах,» Вісник Національного університету «Львівська політехніка». Серія: Інформаційні системи та мережі, № 16, с. 191-202, 2024. https://doi.org/10.23939/sisn2024.16.191 .
[4] S. Vujević, M. Cerjan, and K. Rabuzin, “Data quality in distributed information systems: Conceptual challenges and empirical findings,” in Proc. Central European Conf. Information and Intelligent Systems, 2025, pp. 105-112. [Online]. Available: https://archive.ceciis.foi.hr/public/conferences/2025/Proceedings/S3/3.pdf .
[5] O. Novytskyi, “Concept and evaluation of the big data quality in semantic environment,” Problemy Prohramuvannia, no. 3-4, pp. 260-270, 2022. https://doi.org/10.15407/pp2022.03-04.260 .
[6] B. Heinrich, M. Klier, A. Schiller, and G. Wagner, “Assessing data quality – A probability-based metric for semantic consistency,” Decision Support Systems, vol. 110, pp. 95-106, 2018. https://doi.org/10.1016/j.dss.2018.03.011 .
[7] Z. Tan, et al., “Semantic similarity distance: Towards better text-image consistency metric in text-to-image generation,” Pattern Recognition, vol. 144, p. 109883, 2023. https://doi.org/10.1016/j.patcog.2023.109883 .
[8] N. Wang, and S.-G. Leem, “Modernizing data quality: Evolving dimensions for unstructured text data in big data, AI and ethical contexts,” IntechOpen, 2026. https://doi.org/10.5772/intechopen.1013232 .
[9] M. Klier, A. Obermeier, C. Sparn, and T. Widmann, “Anomaly-based assessment of semantic consistency: Design and evaluation of a novel probability-based metric in cooperation with a German car manufacturer,” Journal of Data and Information Quality, vol. 17, no. 2, art. no. 24, 2025. https://doi.org/10.1145/3732783 .
[10] R. Huidrom, M. Lorandi, S. Mille, C. Thomson, and A. Belz, “Assessing semantic consistency in data-to-text generation: A meta-evaluation of textual, semantic and model-based metrics,” in Proc. 18th Int. Natural Language Generation Conf., Hanoi, Vietnam, 2025, pp. 98-107. [Online]. Available: https://aclanthology.org/2025.inlg-main.6/ .
[11] Ю. М. Геряк та А. Ю. Берко, «Інтелектуальна система виявлення плагіату в технічних текстах,» Вісник Національного університету «Львівська політехніка». Серія: Інформаційні системи та мережі, № 14, с. 235-247, 2023. https://doi.org/10.23939/sisn2023.14.235 .
[12] Ю. М. Геряк, і А. Ю. Берко, «Оцінка семантичної та часової узгодженості розподілених інформаційних ресурсів,» Model. Control Inf. Technol., № 8, с. 125-128, 2025. https://doi.org/10.31713/MCIT.2025.036 .
[13] Y. Heriak, and A. Berko, “Comparison analysis of metrics and evaluation scales of distributed information resources quality parameters,” Вісник Національного університету «Львівська політехніка». Серія: Інформаційні системи та мережі, № 17, с. 130-137, 2025. https://doi.org/10.23939/sisn2025.17.130 .
[14] M. Chen, S. Mao, and Y. Liu, “Big Data: A Survey,” Mobile Networks and Applications, vol. 19, no. 2, pp. 171-209, 2014. https://doi.org/10.1007/s11036-013-0489-0 .