Создание надежной платформы Kubernetes для распределенного обучения ИИ в Atlassian¶
8.0/10
Контекст¶
Когда модели Atlassian переросли объемы памяти одиночных GPU-узлов, распределенное обучение столкнулось с падением производительности из-за сетевых задержек и узких мест хранилища. Ситуация усугублялась тихими сбоями: из-за ошибок конфигурации трафик незаметно переключался с RDMA на TCP-сокеты, снижая скорость работы вдвое, а критический плагин RDMA оставался нерабочим в продакшене 271 день из-за отсутствия синтетических проверок и алертов.
Суть¶
Чтобы решить эти проблемы, инженеры объединили сетевую фабрику RDMA, параллельную файловую систему Lustre (через CSI-драйвер), механизм gang-планирования и автоматическое внедрение сетевых настроек в поды на этапе мутации. Платформа заблокировала запуск задач на частично настроенных узлах и внедрила валидацию реального транспорта до начала обучения. На 16 GPU H200 при тонкой настройке модели Qwen2.5-14B это снизило медианное время шага с 12,36 до 6,07 секунды, увеличив пропускную способность обучения в 2,04 раза при пиковой ширине шины 355 ГБ/с. В качестве компромисса команде пришлось взять на себя ручной учет физической топологии гиперскейлеров и развертывание инстансов Lustre при выходе в новые регионы.
Вывод¶
Масштабное распределенное обучение ИИ становится надежным только тогда, когда высокопроизводительная сеть, хранилище, топологическое планирование и валидация проектируются как единая платформенная система, полностью скрывающая инфраструктурную сложность от разработчиков.