Подход на основе операции Gumbel-Softmax для отбора значимых токенов в механизме самовнимания
Ключевые слова:
трансформер, самовнимание, Gumbel-Softmax, выбор токенов, дифференцируемая маскаАннотация
Квадратичная вычислительная сложность механизма самовнимания в трансформерах остается существенным узким местом для эффективной обработки длинных последовательностей. В данной статье представлен метод снижения вычислительных затрат на использование механизма внимания с помощью дифференцируемого обучения масок, обеспечивающий динамический, зависящий от входных данных отбор токенов и при этом сохраняющий способность модели улавливать глобальную контекстную информацию. Предложенный подход не накладывает каких-либо конкретных архитектурных ограничений и может быть интегрирован в существующие модели трансформеров с минимальными изменениями. В отличие от существующих методов разреженного или приближенного внимания, предложенный подход обучается специфичным для задачи маскам отбора токенов полностью дифференцируемым образом, без наложения предопределенных шаблонов разреженности или архитектурных ограничений. Наш подход использует механизм на основе Gumbel-Softmax для обучения масок выбора токенов в сквозном режиме, предлагая решение, которое сокращает время вывода, сохраняя при этом точность модели. Эксперименты на четырех эталонных наборах данных, предназначенных для анализа настроения, показывают, что предложенный метод обеспечивает сокращение времени вывода на 8-12% при относительном снижении точности менее чем на 1% по сравнению с базовыми моделями. Обучаемые маски поддаются интерпретации, последовательно отдают приоритет токенам, содержащим эмоциональную окраску, и поддерживают эффективный, масштабируемый вывод с помощью трансформеров.
Литература
2. Vaswani A., Shazeer N., Parmar N., et al. Attention is all you need // Proceedings of the 31st International Conference on Neural Information Processing Systems (NIPS’17). 2017. pp. 6000–6010.
3. Fournier Q., Caron G.M., Aloise D. A Practical Survey on Faster and Lighter Transformers // ACM Computing Surveys. 2023. vol. 55. no. 14s. pp. 1–40. DOI: 10.1145/3586074.
4. Han Z., Gao C., Liu J., et al. Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey // arXiv preprint arXiv:2403.14608. 2024.
5. Huang H., Liang Z., Fang Z., et al. A Concise Review of Long Context in Large Language Models // Proceedings of the International Conference on Algorithms, Software Engineering, and Network Security (ASENS’24). 2024. pp. 563–566. DOI: 10.1145/3677182.3677282.
6. Shao M., Basit A., Karri R., Shafique M. Survey of Different Large Language Model Architectures: Trends, Benchmarks, and Challenges // IEEE Access. 2024. vol. 12. pp. 188664–188706. DOI: 10.1109/ACCESS.2024.3482107.
7. Sun W., Hu J., Zhou Y., et al. Speed Always Wins: A Survey on Efficient Architectures for Large Language Models // arXiv preprint arXiv:2508.09834. 2025.
8. Wang X., Salmani M., Omidi P., et al. Beyond the limits: a survey of techniques to extend the context length in large language models // Proceedings of the Thirty Third International Joint Conference on Artificial Intelligence (IJCAI’24). 2024. pp. 8299–8307. DOI: 10.24963/ijcai.2024/917.
9. Zhou Z., Ning X., Hong K., et al. A Survey on Efficient Inference for Large Language Models // arXiv preprint arXiv:2404.14294. 2024.
10. Beltagy I., Peters M.E., Cohan A. Longformer: The Long-Document Transformer // arXiv preprint arXiv:2004.05150. 2020.
11. Child R., Gray S., Radford A., Sutskever I. Generating Long Sequences with Sparse Transformers // arXiv preprint arXiv:1904.10509. 2019.
12. Wang S., Li B.Z., Khabsa M., et al. Linformer: Self-attention with Linear Complexity // arXiv preprint arXiv:2006.04768. 2020.
13. Choromanski K.M., Likhosherstov V.L., Dohan D., et al. Rethinking Attention with Performers // Proceedings of the International Conference on Learning Representations (ICLR’21). 2021. pp. 1–38.
14. Dai Z., Yang Z., Yang Y., et al. Transformer-XL: Attentive Language Models beyond a Fixed-Length Context // Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. 2019. pp. 2978–2988. DOI: 10.18653/v1/P19-1285.
15. Rae J.W., Potapenko A., Jayakumar S.M., et al. Compressive Transformers for Long-Range Sequence Modelling // Proceedings of the International Conference on Learning Representations (ICLR’20). 2020. pp. 1–19.
16. Zaheer M., Guruganesh G., Dubey A., et al. Big Bird: transformers for longer sequences // Proceedings of the 34th International Conference on Neural Information Processing System (NIPS’20). 2020. vol. 21. pp. 17283–17297.
17. Kitaev N., Kaiser L., Levskaya A. Reformer: The Efficient Transformer // Proceedings of the International Conference on Learning Representations (ICLR’20). 2020. pp. 1–12.
18. Kim S., Shen S., Thorsley D., et al. Learned Token Pruning for Transformers // Proceedings of the 28th ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD’22). 2022. pp. 784–794. DOI: 10.1145/3534678.3539260.
19. Ravula A., Alberti C., Ainslie J., et al. ETC: Encoding Long and Structured Inputs in Transformers // Proceedings of the Conference on Empirical Methods in Natural Language Processing (EMNLP). 2020. 268–284.
20. Dao T., Fu D.Y., Ermon S., et al. FLASHATTENTION: fast and memory-efficient exact attention with IO-awareness // Proceedings of the 36th International Conference on Neural Information Processing System (NIPS’22). 2022. pp. 16344–16359.
21. Fu D.Y., Arora S., Grogan J., et al. Monarch MIXER: a simple sub-quadratic GEMM-based architecture // Proceedings of the 37th International Conference on Neural Information Processing Systems (NIPS’23). 2023. pp. 77546–77603.
22. Gu A., Dao T. Mamba: Linear-Time Sequence Modeling with Selective State Spaces // Proceedings of the 1st Conference on Language Modeling. 2024. pp. 1–32.
23. Liu H., Abbeel P. Blockwise Parallel Transformer for Long Context Models // Proceedings of the 36th International Conference on Neural Large Information Processing Systems (NIPS’23). 2023. pp. 8828–8844. DOI: 10.52202/075280-0386.
24. Peng B., Alcaide E., Anthony Q., et al. RWKV: Reinventing RNNs for the Transformer Era // Proceedings of the Conference on Empirical Methods in Natural Language Processing. 2023. pp. 1–30.
25. Guo Y., Ding L., Yuan Y., Wang G. Macformer: Transformer with Random Maclaurin Feature Attention // arXiv preprint arXiv:2408.11656. 2024.
26. Vladymyrov M., von Oswald J., Sandler M., Ge R. Linear Transformers are Versatile In-Context Learners // Proceedings of the 37th International Conference on Neural Information Processing Systems (NIPS’25). 2025. pp. 48784–48809. DOI: 10.52202/079017-1546.
27. Katharopoulos A., Vyas A., Pappas N., Fleuret F. Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention // Proceedings of the 37th International Conference on Machine Learning (PMLR). 2020. vol. 119. pp. 5156–5165.
28. Qin Z., Sun W., Deng H., et al. CosFormer: Rethinking Softmax In Attention // Proceedings of the International Conference on Learning Representations (ICLR’22). 2022. pp. 1–15.
29. Liu J., Pan Z., He H., et al. EcoFormer: Energy-Saving Attention with Linear Complexity // Proceedings of the 36th International Conference on Neural Information Processing Systems (NIPS’22). 2022. pp. 10295–10308.
30. Sanh V., Debut L., Chaumond J., Wolf T. DistilBERT, a distilled version of BERT: smaller, faster, cheaper and Lighter // arXiv preprint arXiv:1910.01108. 2019.
31. Maas A.L., Daly R.E., Pham P.T., et al. Learning word vectors for sentiment analysis // Proceedings of the 49th Annual Meeting of the Association for Computational Linguistics: Human Language Technologies. 2011. vol. 1. pp. 142–150.
32. Socher R., Perelygin A., Wu J., et al. Recursive deep models for semantic compositionality over a sentiment treebank // Proceedings of the Conference on Empirical Methods in Natural Language Processing. 2013. pp. 1631–1642.
33. Pang B., Lee L. Seeing Stars: Exploiting Class Relationships for Sentiment Categorization with Respect to Rating Scales // Proceedings of the 43rd Annual Meeting of the Association for Computational Linguistics (ACL’05). 2005. pp. 115–124. DOI: 10.3115/1219840.1219855.
34. Zhang X., Zhao J., Lecun Y. Character-level convolutional networks for text classification // Proceedings of the 29th International Conference on Neural Information Processing Systems (NIPS’15). 2015. pp. 649–657.
Опубликован
Как цитировать
Раздел
Copyright (c) Андрей Владимирович Константинов, Лев Владимирович Уткин

Это произведение доступно по лицензии Creative Commons «Attribution» («Атрибуция») 4.0 Всемирная.
Авторы, которые публикуются в данном журнале, соглашаются со следующими условиями: Авторы сохраняют за собой авторские права на работу и передают журналу право первой публикации вместе с работой, одновременно лицензируя ее на условиях Creative Commons Attribution License, которая позволяет другим распространять данную работу с обязательным указанием авторства данной работы и ссылкой на оригинальную публикацию в этом журнале. Авторы сохраняют право заключать отдельные, дополнительные контрактные соглашения на неэксклюзивное распространение версии работы, опубликованной этим журналом (например, разместить ее в университетском хранилище или опубликовать ее в книге), со ссылкой на оригинальную публикацию в этом журнале. Авторам разрешается размещать их работу в сети Интернет (например, в университетском хранилище или на их персональном веб-сайте) до и во время процесса рассмотрения ее данным журналом, так как это может привести к продуктивному обсуждению, а также к большему количеству ссылок на данную опубликованную работу (Смотри The Effect of Open Access).