PyTorch делает новый шаг в развитии инфраструктуры искусственного интеллекта, представив систему Monarch. Эта инновационная платформа для распределённых вычислений позволяет управлять тысячами графических процессоров всего лишь с помощью одного простого Python-скрипта. Ранее разработчики использовали подход SPMD, при котором каждый узел в кластере выполнял одинаковый код независимо. С Monarch теперь можно создавать одну управляющую программу, а фреймворк сам распределяет вычисления и синхронизацию между узлами.
Важной новинкой является введение многомерных вычислительных сеток (meshes), которые позволяют процессам и акторам взаимодействовать напрямую, передавая данные между GPU без участия CPU через RDMA. Это значительно снижает накладные расходы и ускоряет выполнение задач, таких как обучение с подкреплением, тонкая настройка и многомодальный анализ.
Кроме того, Monarch полностью совместим с Python, поддерживает Jupyter Notebook и позволяет отлаживать код в реальном времени. Среди других преимуществ — динамическое масштабирование, высокая отказоустойчивость и простота отладки.
Фреймворк уже интегрирован в проекты TorchForge, VERL и Lightning AI, что может сделать его стандартом для будущего распределённого обучения. Monarch фактически объединяет кластер в единый мозг, управляемый из одного интерфейса. Следите за обновлениями!