Monarch

Obter treinamentos distribuídos para funcionar em grandes clusters é difícil! Isso é especialmente verdadeiro quando começamos a olhar para configurações mais complexas, como aprendizado de reforço distribuído. Depurar esses tipos de trabalhos é frustrante, e o tempo de turnaround para alterações tende a ser muito lento. O Monarch é um framework de programação distribuída para PyTorch que torna o cluster programável por meio de uma API Python simples. Ele expõe o supercomputador como um sistema coerente e diretamente controlável, trazendo a experiência de desenvolvimento local para o treinamento em larga escala, como se seu laptop tivesse milhares de GPUs conectadas. Um sistema de treinamento completo pode ser definido em um único programa Python. Os primitivos principais são explícitos e mínimos, permitindo que capacidades de nível superior – como tolerância a falhas, orquestração, integração de ferramentas – sejam construídas como bibliotecas reutilizáveis.

O Monarch é otimizado para uso agente, fornecendo abstrações de infraestrutura consistentes e expostas por meio de APIs SQL padrão que os agentes já são bons em usar. Os agentes podem realizar muitas tarefas de desenvolvimento apenas executando em sua máquina de desenvolvimento, e o Monarch é muito bom em transformar sua máquina de desenvolvimento em um supercomputador, elevando os agentes. O projeto foi lançado na conferência PyTorch em outubro de 2025; você pode ler sobre isso aqui: Apresentando PyTorch Monarch. Este blog aborda como o Monarch evoluiu para se tornar um framework eficaz para o desenvolvimento de treinamento dirigido por agentes. Ele também cobrirá as principais melhorias do Monarch desde outubro, incluindo suporte nativo ao Kubernetes, melhorias no RDMA, telemetria distribuída e muito mais.

Ao representar seu cluster de supercomputação por meio de um modelo coerente de hosts, processos e atores, e combiná-lo com “baterias incluídas” de infraestrutura, o Monarch dá superpoderes ao seu agente! Ele pode gerenciar e depurar código em execução diretamente, sincronizar dependências e dados rapidamente, executar novo código e provisionar hosts, processos e atores adicionais de forma eficiente e consistente, independentemente de onde é implantado. Vamos revisar rapidamente alguns recursos principais que o Monarch usa para habilitar o desenvolvimento agente: coletivamente, esses recursos permitem que os agentes sejam eficientes em algumas fases principais do desenvolvimento; eles podem reiniciar trabalhos rapidamente, sincronizar novo código, dependências e dados rapidamente e depurar rapidamente, tudo a partir de um ponto central. Em resumo, o Monarch torna o sistema distribuído sentir-se local e fornece uma caixa de ferramentas para reduzir o tempo de iteração ao lidar com problemas.

Vamos revisar o que é novo no Monarch desde seu lançamento na conferência PyTorch em outubro de 2025 (há cerca de 6 meses). O Monarch agora tem suporte de primeira classe ao Kubernetes. O Monarch continuou a investir no RDMA, adicionando suporte a novos backends e fornecendo uma API de nível superior para tornar o suporte e o uso mais fáceis. O Monarch se concentrou fortemente na observabilidade e telemetria, adicionando mecanismos programáticos para habilitar o desenvolvimento agente. Há também novos painéis nativos, interface de usuário do terminal (TUIs) e suporte a padrões de código aberto comumente usados por equipes de DevOps. O Monarch agora é significativamente mais compacto e mais rápido para iniciar, tornando-o mais fácil de usar do que nunca.

Gostaríamos de aproveitar a oportunidade para reconhecer alguns colaboradores que ajudaram a tornar o Monarch melhor desde seu lançamento. O Monarch é a API para o seu supercomputador; tornando o desenvolvimento de IA distribuída sentir-se como construir um aplicativo local. O futuro do treinamento de IA exige velocidade e simplicidade, e o Monarch fornece ambos para humanos e agentes. Encorajamos você a explorar os recursos mais recentes, ingressar em nossa comunidade de desenvolvimento de código aberto em crescimento e ajudar a moldar o próximo capítulo da computação distribuída. Agradecemos a toda a equipe do Monarch por tornar esse trabalho possível. Também, um agradecimento especial aos nossos principais colaboradores no GitHub!

Os colaboradores incluem Ahmad Sharif, Allen Wang, Ali Sol, Amir Afzali, Carole-Jean Wu, Chris Gottbrath, Christian Puhrsch, Colin Taylor, Do Hyung (Dave) Kwon, Gayathri Aiyer, Hamid Shojanazeri, Jiyue Wang, Joe Spisak, John William Humphreys, Jun Li, Lucas Pasqualin, Marius Eriksen, Matthew Zhang, Matthias Reso, Peng Zhang, Riley Dulin, Rithesh Baradi, Robert Rusch, Sam Lurye, Samuel Hsia, Shayne Fletcher, Tao Lin, Thomas Wang, Victoria Dudin e Zachary DeVito. Acesse a documentação completa do desenvolvedor para PyTorch, veja os tutoriais aprofundados para iniciantes e desenvolvedores avançados, encontre recursos de desenvolvimento e obtenha respostas para suas perguntas.

Ao enviar este formulário, eu concordo em receber e-mails de marketing da LF e de seus projetos sobre eventos, treinamento, pesquisas, desenvolvimentos e anúncios relacionados. Eu entendo que posso cancelar a assinatura a qualquer momento usando os links nos rodapés dos e-mails que recebo. Política de privacidade. 2026 PyTorch. Copyright 2026 The Linux Foundation. Todos os direitos reservados. A Linux Foundation tem marcas registradas e usa marcas. Para obter mais informações, incluindo termos de uso, política de privacidade e uso de marcas, por favor, consulte nossa página de Políticas. Uso de marcas. Política de privacidade.