МОДЕЛЬ ВИНАГОРОДИ В НАВЧАННІ З ПІДКРІПЛЕННЯМ ДЛЯ ЗАДАЧІ ТЕСТУВАННЯ БЕЗПЕКИ ВЕБЗАСТОСУНКІВ
Ключові слова
Анотація
Досліджено задачу формування функції винагороди для навчання з підкріпленням в аналізі сценаріїв кібератак, у якій традиційні підходи в межах марковських процесів прийняття рішень, орієнтовані переважно на досягнення кінцевого стану, недостатньо відображають часову динаміку компрометації та неоднакову важливість проміжних цілей. Запропоновано модель винагороди, яка поєднує часову складову — час до компрометації (time-to-compromise, TTC) і семантичні ваги проміжних цілей, зокрема дій, пов’язаних із підвищенням привілеїв і доступом до критичних ресурсів. На відміну від традиційних схем винагороди, такий підхід формує локально інформативний сигнал підкріплення, що спрямовує навчання не лише на досягнення компрометації, а й на побудову часово ефективних і структурно змістовних траєкторій атаки. Експериментальне дослідження виконано на 12 стохастично згенерованих MAL-сценаріях (7200 запусків на метод), сформованих на основі відкритих моделей атак. Отримані результати показали, що запропонована модель забезпечує суттєво менше середнє значення TTC порівняно з трьома базовими підходами (перевага від 5 % до 21 %) з високим рівнем статистичної значущості, одночасно підвищуючи частоту успішного досягнення цільового стану і зменшуючи кількість недопустимих дій. Водночас побудовані політики стають інтерпретованішими: частка цільових дій у побудованих траєкторіях зростає, а допоміжні кроки витісняються на користь стратегічно значущих дій підвищення привілеїв. Аналіз чутливості підтвердив стійкість результатів до вибору параметрів моделі. Практичне значення роботи полягає у можливості використання запропонованого підходу для виявлення, ранжування та пріоритезації найнебезпечніших сценаріїв компрометації вебзастосунків з урахуванням їх часової та структурної критичності.
