Весь выпуск
Статьи
-
Доктор технических наук, профессор, директор СПИИРАН Осипов Василий Юрьевич, родился 25 октября 1956 г. в Новгородской области. В 1981 г. окончил Высшее военно-морское училище радиоэлектроники (ВВМУРЭ) им. А.С. Попова (н.в ВМИРЭ им. А.С. Попова) по специальности радиотехнические средства с присвоением квалификации офицера с высшим военно-специальным образованием – военного радиоинженера. С 1981 по 1987 гг. проходил военную службу на Балтийском флоте. В 1987 г. поступил в адъюнктуру при ВВМУРЭ им. А.С. Попова (н.в ВМИРЭ им. А.С. Попова), которую окончил, досрочно защитив кандидатскую диссертацию в 1990 г. Затем назначен на должность старшего преподавателя Калининградского высшего военно-морского училища (н.в. БВВМУ им. адмирала Ф.Ф. Ушакова), где проходил службу до конца 1991 г. В 1991 г. переведен в ВВМУРЭ им. А.С. Попова (н.в ВМИРЭ им. А.С. Попова), где до 1997 г. был старшим преподавателем, доцентом и докторантом, а затем в 1997 г. назначен на должность начальника специальной кафедры, которой руководил до 2007 г. Докторскую диссертацию по техническим наукам на тему «Автоматизированный синтез программ специального назначения» защитил в 2000 г. Ученое звание профессора Осипову В.Ю. присвоено в 2001 г. Воинскую службу завершил в 2007 г. в воинском звании капитана 1 ранга. С 2007 по 2008 гг. работал профессором в ВМИРЭ им. А.С. Попова. В 2008 г. принят на должность ведущего научного сотрудника в Санкт-Петербургском институте информатики и автоматизации Российской академии наук (СПИИРАН). В 2015 г. переведен на должность заведующего лабораторией информационно-вычислительных систем и технологий программирования СПИИРАН. В 2018 г. назначен на должность главного научного сотрудника, а в 2020 г. – на должность директора СПИИРАН.
Искусственный интеллект, инженерия данных и знаний
-
Квадратичная вычислительная сложность механизма самовнимания в трансформерах остается существенным узким местом для эффективной обработки длинных последовательностей. В данной статье представлен метод снижения вычислительных затрат на использование механизма внимания с помощью дифференцируемого обучения масок, обеспечивающий динамический, зависящий от входных данных отбор токенов и при этом сохраняющий способность модели улавливать глобальную контекстную информацию. Предложенный подход не накладывает каких-либо конкретных архитектурных ограничений и может быть интегрирован в существующие модели трансформеров с минимальными изменениями. В отличие от существующих методов разреженного или приближенного внимания, предложенный подход обучается специфичным для задачи маскам отбора токенов полностью дифференцируемым образом, без наложения предопределенных шаблонов разреженности или архитектурных ограничений. Наш подход использует механизм на основе Gumbel-Softmax для обучения масок выбора токенов в сквозном режиме, предлагая решение, которое сокращает время вывода, сохраняя при этом точность модели. Эксперименты на четырех эталонных наборах данных, предназначенных для анализа настроения, показывают, что предложенный метод обеспечивает сокращение времени вывода на 8-12% при относительном снижении точности менее чем на 1% по сравнению с базовыми моделями. Обучаемые маски поддаются интерпретации, последовательно отдают приоритет токенам, содержащим эмоциональную окраску, и поддерживают эффективный, масштабируемый вывод с помощью трансформеров.
-
Принятие эффективных решений для снижения уровня аварийности на автомобильном транспорте основывается на результатах анализа мест концентрации ДТП. Полнота и точность данных о ДТП, используемых для анализа, могут быть повышены за счет интеграции нескольких источников. Важным этапом интеграции является сопоставление записей из различных источников, описывающих одни и те же события ДТП. Решение задачи сопоставления осложняется проблемой гетерогенности: записи о ДТП могут отличаться по структурированности и формату представления. В исследовании предложен метод решения задачи сопоставления записей о ДТП из двух гетерогенных источников: официальных ресурсов со структурированными карточками учета ДТП и новостных публикаций в виде неструктурированных текстов на естественном языке. Предложенный метод основан на гипотезе о пространственной и временной близости: записи из различных источников считаются соответствующими одному ДТП, если описанные в них события произошли на небольшом расстоянии и с незначительной временной разницей. Метод включает два последовательных этапа. На первом этапе из новостных публикаций извлекаются координаты и дата/время описываемого события с использованием экспертных правил, географического справочника и большой языковой модели LLaMA. На втором этапе выполняется сопоставление записей из официальных ресурсов и новостных публикаций на основе пространственно-временной кластеризации с применением алгоритма ST-DBSCAN. Метод позволяет дополнять описание контекста официально зарегистрированных ДТП и обогащать доступные для анализа данные за счет включения ДТП, сведения о которых отсутствуют в официальных источниках. Экспериментальная оценка метода проведена на реальных данных о ДТП в Санкт-Петербурге. Результаты показали, что комбинирование классических методов с большой языковой моделью повышает точность извлечения пространственно-временных атрибутов ДТП из новостных публикаций, а применение пространственно-временной кластеризации обеспечивает высокую точность сопоставления записей о ДТП (F1-мера = 0.84).
-
В условиях повсеместной цифровизации и учащения случаев компрометации конфиденциальной информации актуальность разработки надежных систем аутентификации, выступающих в качестве первоочередного защитного рубежа, становится критически важной. Перспективным решением проблем, связанных с утратой, кражей или несанкционированным использованием статических идентификаторов, представляются биометрические системы поведенческого типа. В частности, методы, основанные на анализе клавиатурного почерка (динамики работы с клавиатурой), позволяют осуществлять непрерывную и скрытую аутентификацию пользователя на протяжении всего сеанса работы, анализируя его уникальные и трудно подделываемые поведенческие паттерны. Данное направление характеризуется сочетанием высокого уровня безопасности с относительно умеренными затратами на внедрение и высоким удобством для конечного пользователя. Целью настоящего исследования является проведение сравнительного анализа различных подходов к проектированию и построению архитектур сверточных нейронных сетей, оптимизированных для обработки разреженных данных, описывающих динамику нажатий клавиш. В ходе экспериментальной работы было установлено, что сверточные нейронные сети демонстрируют исключительно высокую точность верификации, достигающую 99%, несмотря на то, что входные данные, сформированные в результате предобработки, обладают сильной разреженностью. Наилучшие результаты в рамках исследования были достигнуты при использовании архитектуры, основанной на механизме разделенной свертки, которая показала свою эффективность для работы с указанным специфическим типом данных.
-
Рассматривается проблема несбалансированности данных в задачах предварительного отбора признаков с использованием скрининга с гарантированной независимостью. В рамках данного подхода анализируется выбор меры зависимости, применяемой для ранжирования признаков. В работе исследуются два наиболее распространенных показателя взаимосвязи – коэффициент корреляции и взаимная информация. Коэффициент корреляции характеризует линейную зависимость между переменными, его оценки просты в вычислении и обладают хорошими статистическими свойствами. Взаимная информация является более универсальной мерой, способной выявлять нелинейные зависимости, однако ее оценивание требует восстановления распределений по выборочным данным, что приводит к повышенной вычислительной сложности и чувствительности к выбору параметров. На основе серии вычислительных экспериментов показано, что методы оценивания взаимной информации на основе k ближайших соседей уступают ядерным методам с точки зрения устойчивости и качества скрининга. Установлено, что во всех рассмотренных сценариях, включая различные уровни несбалансированности данных, корреляционные меры обеспечивают более стабильные оценки и более надежное ранжирование признаков по сравнению с взаимной информацией. Практическая применимость результатов продемонстрирована на реальных данных электроэнцефалографии, связанных с анализом арифметических способностей. Показано, что двухшаговая процедура, включающая скрининг на основе коэффициента корреляции и последующее моделирование с использованием LASSO-регрессии, обеспечивает существенное снижение ошибки кросс-валидации по сравнению с подходами, основанными на взаимной информации и отсутствием предварительного отбора. Использование главной компоненты, построенной по отобранным признакам, позволяет повысить точность прогноза. Полученные результаты свидетельствуют о том, что в условиях малых выборок, мультиколлинеарности и несбалансированности данных корреляционные меры являются более предпочтительными для задач предварительного отбора признаков с точки зрения устойчивости и воспроизводимости.
-
Известна опасность катастрофических последствий сильных землетрясений. Сейсмические процессы, связанные с подготовкой землетрясений в зоне субдукции, вызывают деформацию поверхностных слоев земной коры, включая осадочный слой, в котором наблюдается явление генерации акустических колебаний, известное как геоакустическая эмиссия (ГАЭ). Основной механизм генерации ГАЭ связан с движением дислокаций при взаимодействии фракций и их скоплений в осадочных породах. Деформации в осадочном слое приводят к изменениям его физических свойств и, как следствие, к изменению условий генерации акустических колебаний. Установлена связь между степенью напряженно-деформированного состояния осадочных пород и интенсивностью импульсного потока ГАЭ. Сигнал ГАЭ представляет собой поток импульсов, следующих с различной скважностью, амплитудой и формой. В периоды повышенной сейсмической активности в осадочных породах наблюдаются изменения параметров сигнала. Детальное изучение изменений характеристик фрагментов сигнала, фиксируемых в периоды, непосредственно связанные с началом землетрясений на Камчатке, и поиск их отличий от изменений фрагментов сигнала в периоды, не связанные с землетрясениями, составили сущность проводимого исследования. В Институте космофизических исследований и распространения радиоволн (ИКИР ДВО РАН) ведется изучение изменчивости характеристик сигналов ГАЭ в периоды, предшествующие землетрясениям, в интересах разработки методов предсказания повышенной вероятности их возникновения на Камчатке. Приведены факты связи отклонений характеристик сигнала с сильными землетрясениями на Камчатке. Отличительной особенностью исследования является представление динамики характеристик сигнала в виде изображений для разномасштабных периодов наблюдений. Результатом исследования явился разработанный метод выделения признаков связи сигнала геоакустической эмиссии с сильными землетрясениями на Камчатке. Критерием степени связи определено значение сходства изображений динамики характеристик сигнала, связанных с моментами начала землетрясений.
Информационная безопасность
-
В работе предложен способ определения факта преобразования аудиосигнала с использованием интеллектуальных средств голосового синтеза (AI-based Voice Conversion, AI-VC) речевых аудиозаписей (например, с целью подмены автора или смыслового наполнения) на основе анализа акустических и статистических признаков аудиосигнала. Рассмотрены принципы работы современных систем преобразования голоса, сделан акцент на архитектуре преобразования голоса на основе поиска (Retrieval-based Voice Conversion, RVC). Показано, что преобразование представляет собой поэтапный процесс, в ходе которого происходит извлечение признаков целевого голоса из исходной речевой аудиозаписи, что эквивалентно векторизации бихевиаристических свойств говорящего, построение целевого шаблона – модели для синтеза голоса, формирование необходимого смыслового наполнения и синтез новой речевой аудиозаписи, имеющей акустически незначимое различие с целевой. Проведен обзор информативных признаков, чувствительных к такому преобразованию и принятых как артефакты синтеза: мел-частотные и линейно-частотные кепстральные коэффициенты (Mel-Frequency Cepstral Coefficients, MFCC, Linear-Frequency Cepstral Coefficients, LFCC), кепстральные коэффициенты на основе постоянного Q (Constant Q Cepstral Coefficients, CQCC), статистические свойства ошибки предсказания (Linear Predictive Coding, LPC), контур основной частоты и его вариативность (джиттер, шиммер), спектральный центроид и поток, скорость пересечения нуля. Разработана формальная модель бинарной классификации и программная реализация на основе гауссовых смесей (Gaussian Mixture Model, GMM). Экспериментальная проверка предложенного способа на наборе данных ASVspoof2019 показала точность классификации 93,9% (AUC = 0,939, EER = 13,52%). Это говорит о том, что предложенный способ может обеспечить защиту получателей речевых аудиозаписей от целевых вишинговых атак по типу спуфинга (мошенничества с подменой голосовой идентичности). Способ может быть реализован в виде программного модуля и интегрирован в мессенджеры или корпоративные коммуникационные платформы. Актуальность работы обусловлена отсутствием готовых продуктов, определяющих голосовые подделки на основе результатов спектрального анализа, несмотря на то, что подобные разработки ведутся как в нашей, так и в зарубежных странах (и обладают точностью на уровне 91-93%), что подтверждается анализом литературы.
-
Современный уровень развития информационных технологий характеризуется широким использованием методов искусственного интеллекта (ИИ), особенно глубокого машинного обучения, в таких важных областях, как здравоохранение, транспорт, финансовые услуги, системы биометрической аутентификации и национальная безопасность. Модели нейронных сетей все чаще используются для принятия решений, которые напрямую влияют на безопасность, здоровье и финансовые интересы отдельных лиц и организаций. Однако по мере повышения функциональной значимости систем искусственного интеллекта растет и их уязвимость к целенаправленным атакам. Существующие подходы к противодействию, такие как состязательное обучение или входная фильтрация, обладают существенными ограничениями: они либо снижают точность модели на легитимных данных, либо эффективны лишь против заранее известных типов атак, не обеспечивая обнаружения новых угроз. В этих условиях возрастает потребность в механизмах детекции, способных определить сам факт атаки независимо от ее реализации. При этом различные исследования показывают, что состязательные примеры вызывают аномальные паттерны активаций в скрытых слоях нейронной сети, качественно отличающиеся от тех, что наблюдаются при обработке легитимных данных. Это открывает возможность применения методов обнаружения аномалий, таких как изоляционный лес или расстояние Махаланобиса – для выявления подозрительных запросов без модификации исходной модели. Особую значимость приобретает также влияние архитектурных и обучающих гиперпараметров на внутренние представления модели и, как следствие, на ее уязвимость и обнаружение атак. Целью данной работы является экспериментальное исследование метода обнаружения состязательных атак на основе анализа аномалий в активациях скрытых слоев нейронной сети.
-
В статье рассматривается задача комплексного анализа защищённости систем Интернета вещей. Актуальность работы обусловлена ростом сложности и гетерогенности систем Интернета вещей, а также необходимостью масштабируемой оценки их защищённости с учётом архитектурных и функциональных особенностей. На основе анализа архитектуры систем Интернета вещей разработана многоуровневая онтологическая модель, объединяющая предметную область Интернета вещей и информационной безопасности, дополненная учётом функциональной роли компонентов системы, типов передаваемых сообщений и целей системы, что позволяет отобразить зависимость критичности компонента от выполняемой функции и влияние угрозы на нарушение целевой функции системы. На основе модели предложен механизм вывода угроз, выявляющий каскадный эффект распространения деструктивного воздействия по топологическому вектору и функциональному вектору. В отличие от подходов, рассматривающих угрозу исключительно через факт первичной компрометации элемента, новизна заключается в том, что глубина и последствия угрозы определяются не начальной компрометацией, а структурно-семантическими характеристиками межкомпонентных связей, задающих развитие каскадного эффекта. Онтология интегрирована с внешними репозиториями знаний (CVE, RVD, CAPEC, CWE, БДУ ФСТЭК) посредством ETL-процесса, а вывод скрытых связей автоматизирован с помощью SWRL-правил в среде Protege. Практическая апробация модели выполнена на экспериментальном стенде «Умная лаборатория». Результатом работы является реализованная онтологическая модель, обеспечивающая автоматическое выявление угроз безопасности для систем Интернета вещей. Оценка качества модели по методике OntoMod показала расширение семантического покрытия предметной области в 3 раза и снижение структурной сложности в 1,5-2,4 раза по сравнению с рассмотренными аналогами. Сформулирован вывод о применимости предложенного онтологического подхода для оперативной поддержки принятия решений операторами и проектировщиками распределенных сетей Интернета вещей.
-
Предложен метод синтеза полностью самопроверяемых цифровых устройств с улучшенными показателями контролепригодности. Решение основано на использовании принципа логической коррекции сигналов и свойств композиции равновесных кодов «1 из 4» и «3 из 4». Описаны особенности организации схемы встроенного контроля по двум диагностическим признакам: принадлежности формируемых кодовых слов композиции равновесных кодов «1 из 4» и «3 из 4», а также каждой функции, описывающей разряды кодовых слов в схеме встроенного контроля классу самодвойственных булевых функций. Приведена структура самопроверяемого цифрового устройства с контролем вычислений по двум диагностическим признакам. Разработаны алгоритмы синтеза схемы встроенного контроля на основе логической коррекции сигналов и композиции равновесных кодов «1 из 4» и «3 из 4», учитывающие требования по тестируемости ее компонентов в процессе эксплуатации. Предложен метод выделения подмножеств контролепригодных четверок выходов на множестве выходов объекта диагностирования, позволяющий гарантированно покрывать ошибки с помощью выбранной композиции равновесных кодов с учетом ее диагностических свойств. Даны некоторые результаты экспериментов с тестовыми схемами, демонстрирующие преимущества разработанного авторами метода синтеза самопроверяемых цифровых устройств по сравнению с известными: дублированием с контролем самодвойственности и с использованием кода «2 из 4» с дополнительным контролем самодвойственности. Разработанный метод может эффективно применяться при синтезе самопроверяемых цифровых устройств как на современной микроэлектронной базе, так и может рассматриваться в будущем при реализации устройств на новых физических принципах.
Математическое моделирование и прикладная математика
-
В современных облачных инфраструктурах и микросервисных архитектурах критически важной задачей является обеспечение высокой надежности, отказоустойчивости и непрерывности функционирования приложений. Основным фактором, снижающим эффективность таких систем, выступает феномен программного старения – постепенная деградация системных ресурсов (утечки памяти, фрагментация данных) в процессе длительной эксплуатации, приводящая к нелинейному росту интенсивности отказов. Сложность прогнозирования надежности в таких условиях обусловлена иерархической зависимостью между общим программным обеспечением хоста и изолированными контейнерами, а также динамическим характером процессов восстановления. В данной статье рассматривается актуальная проблема обеспечения надежности программного обеспечения (ПО) в компьютерной системе с контейнерной виртуализацией, подверженной явлению программного старения. Научная новизна заключается в разработке комплексной математической модели на основе полумарковских процессов, которая учитывает иерархическую структуру системы (общее ПО хоста и изолированные контейнеры) и позволяет оптимизировать стратегии проактивного восстановления. Для описания процесса старения использовано распределение Вейбулла, что отражает возрастающую интенсивность отказов. Предложена полумарковская модель состояний и переходов, включающая механизмы проактивного перезапуска и миграции контейнеров. Для снижения вычислительной сложности разработана упрощенная модель, базирующаяся на допущении о пренебрежимо малой вероятности вторичных отказов в короткие интервалы восстановления. Расчеты стационарных вероятностей и коэффициента готовности реализованы в среде Mathcad. Проведенные численные эксперименты показали, что реализация стратегии проактивного восстановления в диапазоне интервалов 1200-2400 часов существенно повышает коэффициент готовности системы. Установлено, что погрешность упрощенной модели пренебрежимо мала по сравнению со строгой моделью. Предложенная модель позволяет определить максимальное значение коэффициента готовности в зависимости от числа развернутых контейнеров и интервалов проактивного перезапуска контейнеров. Сравнение разработанного подхода с традиционными реактивными моделями восстановления подтверждает преимущество проактивных методов в минимизации простоев, вызванных накоплением ошибок (утечки памяти, фрагментация ресурсов). Предложенная модель может быть применена при проектировании высоконадежных облачных инфраструктур и DevOps-конвейеров.
-
Приведены результаты исследований по совершенствованию моделей и методов оперативной классификации космических аппаратов на основе построения радиолокационных портретов. Предложена гипотеза о том, что минимально необходимое для правильной классификации число радиолокационных портретов является функционалом оригинального показателя интегрального риска, учитывающего стохастический характер негативных факторов, снижающих точностные характеристики радиолокационной станции. Предложена модель классификации подвижных объектов по данным радиолокационных портретов крупноапертурных РЛС L-диапазона с учетом стохастических негативных факторов различной природы. Приведена оригинальная формализация процесса информационного обеспечения классификации космических аппаратов по радиолокационным портретам с использованием двумерного неоднородного дифференциального уравнения для оценки функции плотности вероятности воздействия негативных факторов различной природы на точностные характеристики РЛС. Новизна модели заключается в комплексном учете разнородных факторов на процесс классификации КА, интеграции с риск-анализом и иерархической многоуровневой структуре модели в интересах оперативной классификации. Показано, что представление модели классификации космических аппаратов на основе усовершенствованного риск-анализа обеспечивает получение аналитической зависимости числа радиолокационных портретов с учетом воздействия факторов различной природы, которые формализованы в виде усовершенствованных уравнений Фоккера-Планка (для формализации внутренних факторов) и уравнения Фейнмана-Каца (для внешних факторов, включая динамику реального космического фона). Показано, что совершенствование теории риск-анализа научной школы академика Ю.И. Шокина с учетом результатов решения системы уравнений позволяет существенно улучшить информационное обеспечение задач классификации. Приведены результаты вычислительного эксперимента по обработке радиолокационных портретов, показывающие потенциальную возможность повышения оперативности и точности классификации.
-
Особую актуальность проблема обнаружения аномалий на обрабатываемых изображениях, получаемых с аппаратуры визуального контроля, приобретает в ходе экологического мониторинга акваторий мирового океана при поиске последствий техногенных катастроф, вызванных разливами нефтепродуктов. Под аномалиями в представленном исследовании рассматриваются фрагменты изображения, характеризующие разливы нефтепродуктов. В качестве предмета исследования определены элементы теории распознавания образов, в соответствии с которыми обрабатываемые изображения представляются в виде векторов признаков. Обоснован выбор гистограмм, характеризующих распределения битов яркости обрабатываемых изображений, которые используются в качестве первичных векторов признаков. Установлено, что высокая вариативность фона изображений водных поверхностей приводит к значительной дисперсии векторов признаков, формируемых на основе гистограмм распределения яркости даже для одного общего класса объектов распознавания. Поэтому предложено подвергать первичные векторы признаков декоррелирующей обработке на основе вейвлет-преобразований. Рассмотрены виды вейвлет-преобразования и различные типы формирующих функций, среди которых обоснован выбор вейвлета Гаусса 1-го порядка, позволившего обеспечить наименьшие различия между векторами признаков обрабатываемых изображений, характеризующих один и тот же класс. Предложен подход к формированию вторичных признаков распознавания путем усреднения компонентов матриц кратномасштабного преобразования гистограмм распределения яркости изображений вдоль оси их параметра сдвига. Обоснован переход к выбору избыточного числа масштабов декомпозиции в вейвлет-преобразованиях при формировании вторичных векторов признаков. Демонстрируются результаты проведенного эксперимента, подтверждающие правомерность такого перехода. Представлены тестовые и эталонные изображения, используемые в ходе эксперимента, а также формируемые на их основе первичные и вторичные векторы признаков. Приведены численные результаты, характеризующие полученную оценку различий векторов признаков как одного класса, так и альтернативных классов. Представлена вероятностная оценка результатов распознавания аномалий на обрабатываемых изображениях. Обосновано использование коэффициента оценки различий векторов признаков в разработанной формуле вероятности правильного обнаружения аномалий в обрабатываемых изображениях. Приведены графики, характеризующие значение вероятностной оценки в зависимости от соотношения размеров аномалии к общей площади кадра для различных значений коэффициента, повышающего различия векторов признаков.