ІНТЕЛЕКТУАЛЬНА СИСТЕМА ВИЗНАЧЕННЯ СЕМАНТИЧНОЇ УЗГОДЖЕНОСТІ РОЗПОДІЛЕНИХ ІНФОРМАЦІЙНИХ РЕСУРСІВ
Ключові слова
Анотація
Розглянуто проблему оцінювання якості розподілених інформаційних ресурсів у контексті зростання обсягів, різнорідності та динаміки даних, що циркулюють у сучасних інформаційних системах. Показано, що для розподілених середовищ традиційних підходів до контролю якості даних, які базуються переважно на точності, повноті та узгодженості, уже недостатньо, оскільки вони не враховують семантичну неоднорідність, контекст використання, реплікацію, варіативність представлення сутностей та відмінності у правилах інтерпретації даних. Особливу увагу приділено семантичній узгодженості як ключовій характеристиці, від якої залежить коректність інтеграції даних, достовірність аналітичних висновків і якість автоматизованих рішень у гетерогенних середовищах.
Розроблено інтелектуальну систему визначення семантичної узгодженості розподілених інформаційних ресурсів, побудовану на гібридному підході, що поєднує синтаксичні метрики швидкого відсіву та глибокий семантичний аналіз на основі векторних представлень. Така архітектура дає змогу ефективно працювати як з очевидно узгодженими парами даних, так і зі складними випадками, де однаковий зміст подано різними лексичними засобами, скороченнями або доменними синонімами. Додатково реалізовано адаптивне порогове прийняття рішень, що дозволяє налаштовувати суворість перевірки залежно від типу атрибута та предметної області застосування, а також формувати інтегральний індекс семантичної узгодженості для подальшого моніторингу якості даних.
Експериментальна перевірка підтвердила доцільність впровадженого підходу для підвищення точності виявлення семантично еквівалентних, але формально різних записів. Отримані результати показали, що поєднання синтаксичних і семантичних методів дає змогу суттєво зменшити кількість хибних відмов і помилкових збігів у процесі порівняння атрибутів, а також створює методологічне підґрунтя для побудови масштабованих систем контролю якості розподілених інформаційних ресурсів. Практичне значення роботи полягає в можливості інтеграції розробленої системи до платформ моніторингу, валідації та керування якістю даних у фінансових, медичних, наукових та інших гетерогенних інформаційних середовищах
