Перейти к содержанию

SSOG-Attention: субквадратичная альтернатива SDPA на основе гауссиан

6.0/10

SSOG-Attention (Sum Of Separable Gaussians) предложен как альтернатива Scaled Dot-Product Attention (SDPA) с субквадратичной сложностью O(N·√N·d) вместо O(N²·d). Метод обучает несколько гауссовых атомов для каждой головы внимания и геометрически управляет ими на основе query-токена, используя разложимость в сумму разделимых гауссиан. Эксперименты показывают, что SSOG уверенно превосходит SDPA на CIFAR100 и демонстрирует сопоставимое качество с более быстрой сходимостью на ImageNet1k (IN1k), оставаясь быстрее и экономнее по памяти при росте масштаба. Автор опубликовал блог-пост и репозиторий на GitHub, отмечая применение ИИ для части кода и текста, но подтверждая достоверность проекта.

Предпосылки

Scaled Dot-Product Attention (SDPA) — стандартный механизм трансформеров, вычисляющий попарные сходства всех токенов за квадратичную сложность O(N²·d), что ограничивает работу с длинными последовательностями. Исследования эффективного внимания стремятся снизить эту сложность, особенно в визуальных задачах, где токены обладают пространственной структурой.

Влияние

Метод даёт разработчикам визуальных трансформеров открытую реализацию с пониженной сложностью O(N·√N·d), ускоряющую сходимость на ImageNet1k при сохранении качества SDPA. Заявленные метрики пока не подтверждены независимыми проверками вне представленного поста.

Обсуждение

Участники похвалили наглядность материалов и фокус на эффективности, предложили аппроксимировать гауссиан боксовым ядром и указали на связь с литературой по гауссовым процессам с кронекеровской структурой. Звучали вопросы об использовании ИИ при подготовке текста, сомнения в полной новизне из-за ранее опубликованных компонентов, а также замечания о трудностях адаптации под текстовые задачи.