ІНТЕЛЕКТУАЛЬНА ТЕХНОЛОГІЯ ВИЯВЛЕННЯ ТЕКСТОВИХ ДІПФЕЙКІВ З ВИКОРИСТАННЯМ ВЕЛИКИХ МОВНИХ МОДЕЛЕЙ
Ключові слова
Анотація
Стрімкий розвиток великих мовних моделей в останні роки породжує важливу проблему — зростання обсягу синтезованих текстів в інформаційному середовищі, що викликає загрозу поширення дезінформації. Відповідно удосконалення технологій виявлення таких текстів стає актуальним завданням.
В статті запропоновано інтелектуальну технологію автоматичної ідентифікації текстів, згенерованих за допомогою штучного інтелекту, зокрема великими мовними моделями. Дослідження базується на аналізі розв’язків конкурсу «LLM — Detect AI Generated Text» на платформі Kaggle. Для цього побудовано датасет, що містить приклади текстів двох класів: ті, що написані людиною, та ті, що згенеровані великими мовними моделями. Датасет зібрано з даних, що знаходяться в публічному доступі. Також проведено розвідувальний аналіз даних та продемонстровано основні особливості підготовленого датасету.
Проаналізовано популярні методи розв’язання задачі ідентифікації згенерованих великими мовними моделями текстів в межах конкурсу на платформі Kaggle. Формалізовано загальну структуру рішення та обґрунтовано основні фактори впливу на точність ідентифікації текстів, згенерованих штучним інтелектом. Розроблено алгоритм для підвищення точності рішення завдяки операціям перед- та післяоброблення, покращення тренувального датасету, оптимізації вибору моделей та методу їхнього ансамблювання тощо. Проведено експерименти, які продемонстрували ефективність запропонованої інтелектуальної технології.
Це дослідження робить внесок у розвиток технологій боротьби з дезінформацією та підкреслює важливість пошуку нових методів виявлення штучно створених текстів у сучасному інформаційному середовищі.
