По мере того как передовые модели искусственного интеллекта экспоненциально увеличиваются в масштабах, их обучение и обслуживание начинают напрямую зависеть от сверхбыстрых и высоконадежных сетей. Главная инженерная проблема заключается в бесшовной передаче огромных объемов данных между GPU, чтобы дорогостоящие вычислительные циклы никогда не тратились впустую на ожидание передачи информации. Чтобы напрямую решить эту проблему сетевых заторов, компания Meta разработала MetaRoCE — совершенно новый транспортный протокол RDMA (Remote Direct Memory Access), созданный с нуля специально для интенсивных ИИ-нагрузок, функционирующих на стандартной инфраструктуре Ethernet.
Переосмысление RDMA для современной ИИ-инфраструктуры
Традиционные сетевые протоколы часто не справляются с интенсивными и одновременными паттернами трафика, которые возникают при распределенном обучении ИИ-моделей. Графическим процессорам требуется быстрый обмен данными между огромными массивами кластеров, из-за чего сетевые задержки и потеря пакетов становятся критическими факторами, способными серьезно ухудшить общую производительность. Создавая MetaRoCE, инженеры стремились устранить эти факторы трения путем адаптации транспортного протокола RDMA под точные требования современных кластеров искусственного интеллекта без необходимости использования проприетарного и нестандартного сетевого оборудования.
В целях стимулирования широкого внедрения, совместимости экосистем и строгой стандартизации инициатива включает в себя комплексные технические релизы:
- Полная спецификация MetaRoCE, подробно описывающая архитектуру протокола.
- Функциональная эталонная программная реализация в помощь разработчикам и инженерам.
- Специализированный набор тестов на соответствие (compliance test) для проверки правильности развертывания и совместимости.
Оптимизация стандартного Ethernet для передовых нагрузок
Основной концепцией проектирования MetaRoCE является использование экономической эффективности и повсеместного распространения стандартного Ethernet при одновременном достижении характеристик производительности, которые обычно свойственны специализированным суперкомпьютерным сетям. Оптимизируя транспортные уровни RDMA для операций масштаба ИИ, дата-центры могут более эффективно масштабировать свои вычислительные кластеры, снижая накладные расходы и максимизируя использование базовых ресурсов GPU.
Источник: Оригинальная статья





