NVIDIA представила корпоративные рабочие процессы с использованием NVIDIA FLARE для обучения мультимодальных моделей искусственного интеллекта в распределенных средах без централизации конфиденциальных данных. Современные архитектуры зрительно-языковых моделей требуют огромных специализированных наборов данных, которые часто хранятся в разных организациях со строгими требованиями к соблюдению нормативных требований. Координируя децентрализованные тренировочные прогоны, организации могут совместно оптимизировать передовые зрительно-языковые модели, сохраняя при этом строгую локальную защиту данных.
Проблема централизации мультимодальных данных
Зрительно-языковые модели (VLM) объединяют компьютерное зрение и обработку естественного языка для контекстуализации сложных визуальных сцен вместе с текстовыми подсказками. Адаптация базовых VLM к специализированным областям, таким как здравоохранение, промышленный контроль и соблюдение нормативных требований, требует доступа к конфиденциальным проприетарным наборам данных. Однако корпоративные требования конфиденциальности и нормативно-правовая база запрещают объединять необработанные изображения и документацию на централизованных серверах или сторонних облачных платформах.
Эта децентрализация создает изолированные хранилища данных, мешая отдельным организациям собирать объем и разнообразие высококачественных мультимодальных образцов, необходимых для независимого обучения надежных базовых архитектур.
Архитектура федеративного обучения для зрительно-языковых моделей
Федеративное обучение решает эти проблемы с данными путем организации обучения на распределенных клиентских сайтах при строгом сохранении локальных записей. Вместо передачи конфиденциальных медиаданных в централизованное хранилище центральный оркестратор отправляя глобальную архитектуру модели на участвующие узлы. Каждый узел выполняет локальные итерации обучения на своих закрытых данных и передает на сервер агрегации только обновления параметров или вычисления градиентов.
NVIDIA FLARE (Federated Learning Application Runtime Environment) предоставляет открытую платформу, не зависящую от конкретной предметной области и предназначенную для организации этих сложных многоуровневых операций. Среда выполнения управляет протоколами связи, конвейерами выполнения и алгоритмами агрегации для поддержания непрерывной оптимизации моделей на гетерогенной инфраструктуре.
Основные преимущества федеративных мультимодальных рабочих процессов
- Сохранение конфиденциальности данных: Необработанные визуальные активы, проприетарная документация и метаданные организаций остаются полностью в пределах локальных периметров безопасности.
- Междоменное мультимодальное выравнивание: Позволяет зрительно-языковым кодировщикам и механизмам перекрестного внимания изучать общие эмбеддинги из разнообразных распределений без объединения записей.
- Стандартизированная оркестрация: Упрощает управление заданиями, синхронизацию клиентов и серверов, а также стратегии агрегации в различных вычислительных средах.
- Совместная генерализация: Смягчает переобучение на локализованных наборах данных путем агрегирования разнообразных представлений признаков от нескольких участников-организаций.
Последствия для межведомственного сотрудничества
Развертывание федеративных рабочих процессов для зрительно-языковых моделей решает проблему высоких вычислительных и коммуникационных издержек за счет структурированной синхронизации градиентов и модульных конвейеров обучения. Эта архитектура предоставляет предприятиям и исследовательским институтам практический план для совместного масштабирования современного мультимодального ИИ без ущерба для соблюдения нормативных требований или границ безопасности.
Источник: Оригинальная статья

