Обнаружение состязательных атак через выявление аномалий в скрытых слоях нейросети
Ключевые слова:
искусственный интеллект, глубокое машинное обучение, нейронные сети, состязательная атака, обнаружение атак, аномалии, скрытые активации, внутренние представления модели, изоляционный лес, метрики оценки качества моделиАннотация
Современный уровень развития информационных технологий характеризуется широким использованием методов искусственного интеллекта (ИИ), особенно глубокого машинного обучения, в таких важных областях, как здравоохранение, транспорт, финансовые услуги, системы биометрической аутентификации и национальная безопасность. Модели нейронных сетей все чаще используются для принятия решений, которые напрямую влияют на безопасность, здоровье и финансовые интересы отдельных лиц и организаций. Однако по мере повышения функциональной значимости систем искусственного интеллекта растет и их уязвимость к целенаправленным атакам. Существующие подходы к противодействию, такие как состязательное обучение или входная фильтрация, обладают существенными ограничениями: они либо снижают точность модели на легитимных данных, либо эффективны лишь против заранее известных типов атак, не обеспечивая обнаружения новых угроз. В этих условиях возрастает потребность в механизмах детекции, способных определить сам факт атаки независимо от ее реализации. При этом различные исследования показывают, что состязательные примеры вызывают аномальные паттерны активаций в скрытых слоях нейронной сети, качественно отличающиеся от тех, что наблюдаются при обработке легитимных данных. Это открывает возможность применения методов обнаружения аномалий, таких как изоляционный лес или расстояние Махаланобиса – для выявления подозрительных запросов без модификации исходной модели. Особую значимость приобретает также влияние архитектурных и обучающих гиперпараметров на внутренние представления модели и, как следствие, на ее уязвимость и обнаружение атак. Целью данной работы является экспериментальное исследование метода обнаружения состязательных атак на основе анализа аномалий в активациях скрытых слоев нейронной сети.
Литература
2. Kotenko I., Saenko I., Lauta O., et al. Analysis of Modern Research on Protection against Adversarial Attacks in Energy Systems // Informatics and Automation. 2025. vol. 24. no. 6. pp. 1751–1809. DOI: 10.15622/ia.24.6.8.
3. Wang H., Wu C., Zheng K. Defense against adversarial attacks based on color space transformation // Neural Networks. 2024. vol. 173. 106176 p. DOI: 10.1016/J.NEUNET.2024.106176.
4. Brau F., Rossolini G., Biondi A., Butazzo G. On the Minimal Adversarial Perturbation for Deep Neural Networks With Provable Estimation Error // IEEE Transactions on Pattern Analysis and Machine Intelligence. 2022. vol. 45. pp. 5038–5052. DOI: 10.1109/TPAMI.2022.3195616.
5. Szegedy C., Zaremba W., Sutskever I., et al. Intriguing properties of neural networks // arXiv preprint arXiv:1312.6199. 2013.
6. Hong F., Bouhassira R., Chow J., et al. Comprehensive characterization of human color discrimination thresholds // bioRxiv. 2025. pp. 1–70. DOI: 10.1101/2025.07.16.665219.
7. Goodfellow I.J., Shlens J., Szegedy C. Explaining and harnessing adversarial examples // Proceedings of the 3rd International Conference on Learning Representations (ICLR). 2015. pp. 1–11.
8. Papernot N., McDaniel P., Jha S., et al. The Limitations of Deep Learning in Adversarial Settings // Proceedings of the IEEE European Symposium on Security and Privacy (EuroS&P). 2016. pp. 372–387. DOI: 10.1109/EuroSP.2016.36.
9. Zhu Z., Chen H., Wang X., et al. Ge-AdvGAN: Improving the transferability of adversarial samples by gradient editing-based adversarial generative model // Proceedings of the 2024 SIAM International Conference on Data Mining (SDM). 2024. pp. 706–714.
10. Carlini N., Wagner D. Towards Evaluating the Robustness of Neural Networks // Proceedings of the IEEE Symposium on Security and Privacy (SP). 2017. pp. 39–57. DOI: 10.1109/SP.2017.49.
11. Wang Y., Liao X., Cui W., et al. Defending against and generating adversarial examples together with generative adversarial networks // Scientific Reports. 2025. vol. 15. 12994 p. DOI: 10.1038/s41598-024-83444-x.
12. Xu L., Zhai J. Generating adversarial examples with collaborative generative models // International Journal of Information Security. 2024. vol. 23. pp. 1077–1091. DOI: 10.1007/S10207-023-000780-1.
13. Madry A., Makelov A., Schmidt L., et al. Towards deep learning models resistant to adversarial attacks // Proceedings of the International Conference on Learning Representations (ICLR). 2018. pp. 1–28.
14. Kurakin A., Goodfellow I.J., Bengio S. Adversarial Examples in the Physical World // Proceedings of the 5th International Conference on Learning Representations. 2017. pp. 99–112.
15. Gui J., Sun Z., Wen Y., et al. A Review on Generative Adversarial Networks: Algorithms, Theory, and Applications // IEEE Transactions on Knowledge and Data Engineering. 2023. vol. 35. pp. 3313–3332. DOI: 10.1109/TKDE.2021.3130191.
16. Chandola V., Banerjee A., Kumar V. Anomaly detection: A survey // ACM Computing Surveys (CSUR). 2009. vol. 41. no. 3. pp. 1–58. DOI: 10.1145/1541880.1541882.
17. Li Z., Wang W., Li J., et al. UCG: A Universal Cross-Domain Generator for Transferable Adversarial Examples // IEEE Transactions on Information Forensics and Security. 2024. vol. 19. pp. 3023–3037. DOI: 10.1109/TIFS.2024.3352913.
18. Scholkopf B., Platt J.C., Shawe-Taylor J., et al. Estimating the Support of a High-Dimensional Distribution // Neural Computation. 2001. vol. 13. no. 7. pp. 1443–1471. DOI: 10.1162/089976601750264965.
19. Fawcett T. An introduction to ROC analysis // Pattern Recognition Letters. 2006. vol. 27. no. 8. pp. 861–874. DOI: 10.1016/j.patrec.2005.10.010.
20. Lee K., Lee K., Lee H., Shin J. A Simple Unified Framework for Detecting Out-of-Distribution Samples and Adversarial Attacks // Advances in Neural Information Processing Systems. 2018. vol. 31. pp. 1–11.
21. Feng W., Xu N., Zhang T., et al. Robust and Generalized Physical Adversarial Attacks via Meta-Gan // IEEE Transactions on Information Forensics and Security. 2023. vol. 19. pp. 1112–1125. DOI: 10.1109/TIFS.2023.3288426.
22. Клименко Д.М., Козлова Е.И. Исследование влияния гиперпараметров на точность нейросетевого предсказания с использованием набора данных Fashion-MNIST // Цифровая трансформация. 2026. Т. 32. №2. С. 44–52. DOI: 10.35596/1729-7648-2026-32-2-44-52.
23. Ma X., Li B., Wang Y., et al. Characterizing Adversarial Subspaces Using Local Intrinsic Dimensionality // Proceedings of the 6th International Conference on Learning Representations (ICLR). 2018. pp. 1–15.
Опубликован
Как цитировать
Раздел
Copyright (c) Елена Ивановна Козлова

Это произведение доступно по лицензии Creative Commons «Attribution» («Атрибуция») 4.0 Всемирная.
Авторы, которые публикуются в данном журнале, соглашаются со следующими условиями: Авторы сохраняют за собой авторские права на работу и передают журналу право первой публикации вместе с работой, одновременно лицензируя ее на условиях Creative Commons Attribution License, которая позволяет другим распространять данную работу с обязательным указанием авторства данной работы и ссылкой на оригинальную публикацию в этом журнале. Авторы сохраняют право заключать отдельные, дополнительные контрактные соглашения на неэксклюзивное распространение версии работы, опубликованной этим журналом (например, разместить ее в университетском хранилище или опубликовать ее в книге), со ссылкой на оригинальную публикацию в этом журнале. Авторам разрешается размещать их работу в сети Интернет (например, в университетском хранилище или на их персональном веб-сайте) до и во время процесса рассмотрения ее данным журналом, так как это может привести к продуктивному обсуждению, а также к большему количеству ссылок на данную опубликованную работу (Смотри The Effect of Open Access).