ЗАСТОСУВАННЯ АЛГОРИТМІВ МАШИННОГО НАВЧАННЯ ДЛЯ ВИЗНАЧЕННЯ НАЯВНОСТІ ЦУКРОВОГО ДІАБЕТУ У ПАЦІЄНТІВ
Ключові слова
Анотація
Досліджено та розглянуто практичне застосування сучасних методів машинного навчання для розв’язання проблеми виявлення наявності цукрового діабету у пацієнтів. На початковому етапі робота зосереджена на попередній обробці даних: виявленню порожніх та аномальних значень, вивченню змінних набору даних тощо. Для узагальнення, організації та представлення основних характеристик набору даних використана описова статистика. Для числових змінних отримано ключові показники: середнє, медіана, стандартне відхилення, мінімальне та максимальне значення, а також квартилі. Це дозволило оцінити центральну тенденцію даних, їхній розкид, діапазон та виявити нерівномірності у розподілі. Для категоріальних змінних визначено кількість унікальних значень, найпоширенішу категорію та її частоту. Описано використання алгоритмів машинного навчання для визначення цукрового діабету у пацієнтів. Поставлено завдання передбачити наявність (результат = 1) або відсутність (результат = 0) діабету у пацієнток на основі низки діагностичних показників, зокрема рівня глюкози, артеріального тиску, товщини шкірної складки, рівня інсуліну, індексу маси тіла, віку тощо. У межах дослідження здійснено аналіз вхідних даних з метою виявлення закономірностей, взаємозв’язків між діагностичними параметрами, аналізу розподілу ознак, а також виявлення потенційних викидів. Для побудови моделей розглянуто та застосовано кілька алгоритмів класифікації, зокрема логістична регресія, метод k-найближчих сусідів та випадковий ліс. Кінцевим етапом дослідження стало порівняння ефективності різних алгоритмів. Найкращі результати продемонструвала модель логістичної регресії з адаптованим порогом класифікації. У роботі застосовано зміщення порогу прийняття рішення від стандартного значення 0,5 до діапазону 0,25...0,3, що дозволило мінімізувати помилки другого роду (хибнонегативні результати). Це важливо для ранньої діагностики діабету, оскільки дозволяє виявити більшу кількість хворих пацієнтів, які могли бути пропущені у разі стандартних налаштувань моделі.
