Способ определения AI-преобразованных речевых аудиозаписей на основе акустических и статистических признаков
Ключевые слова:
противодействие вишингу, искусственный интеллект, дипфейк, преобразование голоса, спуфинг, машинное обучение, акустические признаки, статистические признакиАннотация
В работе предложен способ определения факта преобразования аудиосигнала с использованием интеллектуальных средств голосового синтеза (AI-based Voice Conversion, AI-VC) речевых аудиозаписей (например, с целью подмены автора или смыслового наполнения) на основе анализа акустических и статистических признаков аудиосигнала. Рассмотрены принципы работы современных систем преобразования голоса, сделан акцент на архитектуре преобразования голоса на основе поиска (Retrieval-based Voice Conversion, RVC). Показано, что преобразование представляет собой поэтапный процесс, в ходе которого происходит извлечение признаков целевого голоса из исходной речевой аудиозаписи, что эквивалентно векторизации бихевиаристических свойств говорящего, построение целевого шаблона – модели для синтеза голоса, формирование необходимого смыслового наполнения и синтез новой речевой аудиозаписи, имеющей акустически незначимое различие с целевой. Проведен обзор информативных признаков, чувствительных к такому преобразованию и принятых как артефакты синтеза: мел-частотные и линейно-частотные кепстральные коэффициенты (Mel-Frequency Cepstral Coefficients, MFCC, Linear-Frequency Cepstral Coefficients, LFCC), кепстральные коэффициенты на основе постоянного Q (Constant Q Cepstral Coefficients, CQCC), статистические свойства ошибки предсказания (Linear Predictive Coding, LPC), контур основной частоты и его вариативность (джиттер, шиммер), спектральный центроид и поток, скорость пересечения нуля. Разработана формальная модель бинарной классификации и программная реализация на основе гауссовых смесей (Gaussian Mixture Model, GMM). Экспериментальная проверка предложенного способа на наборе данных ASVspoof2019 показала точность классификации 93,9% (AUC = 0,939, EER = 13,52%). Это говорит о том, что предложенный способ может обеспечить защиту получателей речевых аудиозаписей от целевых вишинговых атак по типу спуфинга (мошенничества с подменой голосовой идентичности). Способ может быть реализован в виде программного модуля и интегрирован в мессенджеры или корпоративные коммуникационные платформы. Актуальность работы обусловлена отсутствием готовых продуктов, определяющих голосовые подделки на основе результатов спектрального анализа, несмотря на то, что подобные разработки ведутся как в нашей, так и в зарубежных странах (и обладают точностью на уровне 91-93%), что подтверждается анализом литературы.
Литература
2. CEO ‘Deep Fake’ Swindles Company Out of $243k // Threatpost. URL: https://threatpost.com/deep-fake-of-ceos-voice-swindles-company-out-of-243k/147982/ (дата обращения: 07.10.2024).
3. Cost of a Data Breach Report 2024 // IBM. URL: https://www.ibm.com/downloads/documents/us-en/107a02e94948f4ec (дата обращения: 22.10.2024).
4. Долгушин М.Д., Карпов А.А. Аналитический обзор речевых и многомодальных методов распознавания когнитивных нарушений людей // Информатика и автоматизация. 2025. Т. 24. №6. С. 1683–1720. DOI: 10.15622/ia.24.6.6.
5. Das R.K., Kinnunen T., Huang W.-C., et al. Predictions of Subjective Ratings and Spoofing Assessments of Voice Conversion Challenge 2020 Submissions // arXiv preprint arXiv:2009.03554. 2020.
6. RVC Project. Retrieval-based Voice Conversion WebUI // GitHub. URL: https://github.com/RVC-Project/Retrieval-based-Voice-Conversion-WebUI (дата обращения: 05.02.2025).
7. Hemavathi R., Kumaraswamy R. Voice conversion spoofing detection by exploring artifacts estimates // Multimedia Tools and Applications. 2021. vol. 80. no. 15. pp. 23561–23580. DOI: 10.1007/s11042-020-10212-0.
8. Delgado H., Evans N., Kinnunen T., et al. ASVspoof 2021: Automatic Speaker Verification Spoofing and Countermeasures Challenge Evaluation Plan // arXiv preprint arXiv:2109.00535. 2021.
9. Sahidullah M., Kinnunen T., Hanilci C. A Comparison of features for synthetic speech detection // Proceedings of Interspeech. 2015. pp. 2087–2091.
10. Kawa P., Plata M., Syga P. SpecRNet: Towards Faster and More Accessible Audio DeepFake Detection // Proceedings of IEEE International Conference on Trust, Security and Privacy in Computing and Communications (TrustCom). 2022. pp. 792–799. DOI: 10.1109/TrustCom56396.2022.00111.
11. The Automatic Speaker Verification Spoofing and Countermeasures Challenge // ASVspoof. URL: https://www.asvspoof.org (дата обращения: 01.06.2025).
12. Kong J., Kim J., Bae J. HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis // Proceedings of the 34th International Conference on Neural Information Processing Systems (NIPS'20). 2020. no. 1428. pp. 17022–17033.
13. Wu Z., Evans N., Kinnunen T., Yamagishi J., Alegre F., Li H. Spoofing and countermeasures for speaker verification: A survey // Speech Communication. 2015. vol. 66. pp. 130–153. DOI: 10.1016/j.specom.2014.10.005.
14. Frank J., Schonherr L. WaveFake: A Data Set to Facilitate Audio Deepfake Detection // arXiv preprint arXiv:2111.02813. 2021.
15. Paul D., Pal M., Saha G. Spectral Features for Synthetic Speech Detection // IEEE Journal of Selected Topics in Signal Processing. 2017. vol. 11. no. 4. pp. 605–617. DOI: 10.1109/JSTSP.2017.2684705.
16. Lavrentyeva G., Novoselov S., Malykh E., et al. Audio Replay Attack Detection with Deep Learning Frameworks // Proceedings of Interspeech. 2017. pp. 82–86.
17. Tak H., Kamble M., Patino J., Todisco M., Evans N. Rawboost: A Raw Data Boosting and Augmentation Method Applied to Automatic Speaker Verification Anti-Spoofing // Proceedings of IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). 2022. pp. 6382–6386. DOI: 10.1109/ICASSP43922.2022.9746213.
18. Alegre F., Amehraye A., Evans N. A one-class classification approach to generalised speaker verification spoofing countermeasures using local binary patterns // Proceedings of IEEE Sixth International Conference on Biometrics: Theory, Applications and Systems (BTAS). 2013. pp. 1–8. DOI: 10.1109/BTAS.2013.6712706.
19. Paul D., Sahidullah M., Saha G. Generalization of spoofing countermeasures: A case study with ASVspoof 2015 and BTAS 2016 corpora // Proceedings of IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). 2017. pp. 2047–2051. DOI: 10.1109/ICASSP.2017.7952516.
20. Himawan I., Villavicencio F., Sridharan S., Fookes C. Deep domain adaptation for anti-spoofing in speaker verification systems // Computer Speech & Language. 2019. vol. 58. pp. 377–402. DOI: 10.1016/j.csl.2019.05.007.
21. Tak H., Todisco M., Wang X., et al. Automatic Speaker verification spoofing and deepfake detection using wav2vec 2.0 and data augmentation // arXiv preprint arXiv:2202.12233. 2022.
22. Wang X., Yamagishi J., Todisco M., et al. ASVspoof 2019: A large-scale public database of synthesized, converted and replayed speech // Computer Speech & Language. 2020. vol. 64. DOI: 10.1016/j.csl.2020.101114.
23. Alzantot M., Wang Z., Srivastava M.B. Deep Residual Neural Networks for Audio Spoofing Detection // arXiv preprint arXiv:1907.0050. 2019.
24. Tak H., Patino J., Todisco M., et al. End-to-End anti-spoofing with RawNet2 // Proceedings of IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). 2021. pp. 6369–6373. DOI: 10.1109/ICASSP39728.2021.9414234.
25. Baas M., van Niekerk B., Kamper H. Voice Conversion With Just Nearest Neighbors // arXiv preprint arXiv:2305.18975. 2023.
Опубликован
Как цитировать
Раздел
Copyright (c) Анастасия Дмитриевна Шульженко; Ульяна Владимировна Токарева; Николай Юрьевич Мирошников

Это произведение доступно по лицензии Creative Commons «Attribution» («Атрибуция») 4.0 Всемирная.
Авторы, которые публикуются в данном журнале, соглашаются со следующими условиями: Авторы сохраняют за собой авторские права на работу и передают журналу право первой публикации вместе с работой, одновременно лицензируя ее на условиях Creative Commons Attribution License, которая позволяет другим распространять данную работу с обязательным указанием авторства данной работы и ссылкой на оригинальную публикацию в этом журнале. Авторы сохраняют право заключать отдельные, дополнительные контрактные соглашения на неэксклюзивное распространение версии работы, опубликованной этим журналом (например, разместить ее в университетском хранилище или опубликовать ее в книге), со ссылкой на оригинальную публикацию в этом журнале. Авторам разрешается размещать их работу в сети Интернет (например, в университетском хранилище или на их персональном веб-сайте) до и во время процесса рассмотрения ее данным журналом, так как это может привести к продуктивному обсуждению, а также к большему количеству ссылок на данную опубликованную работу (Смотри The Effect of Open Access).