ByteDance Apresenta Astra
A ByteDance introduz o Astra, uma arquitetura inovadora de modelo duplo que revoluciona a navegação de robôs em ambientes internos complexos. Com a integração crescente de robôs em vários setores, desde a manufatura industrial até a vida cotidiana, destaca-se a necessidade de sistemas de navegação avançados. No entanto, os sistemas de navegação de robôs contemporâneos enfrentam desafios significativos em ambientes internos diversos e complexos, expostos as limitações das abordagens tradicionais. Para responder às questões fundamentais de “Onde estou?”, “Para onde estou indo?” e “Como chego lá?”, a ByteDance desenvolveu o Astra, uma arquitetura inovadora de modelo duplo projetada para superar esses gargalos de navegação tradicionais e permitir que os robôs móveis tenham um propósito geral.
Os sistemas de navegação tradicionais geralmente consistem em vários módulos menores e frequentemente baseados em regras para lidar com os desafios básicos de localização de alvo, auto-localização e planejamento de trajetória. A localização de alvo envolve entender pistas de linguagem natural ou imagens para localizar um destino em um mapa. A auto-localização requer que o robô determine sua posição exata dentro de um mapa, especialmente desafiador em ambientes repetitivos, como armazéns, onde os métodos tradicionais frequentemente dependem de marcos artificiais (por exemplo, códigos QR). O planejamento de trajetória divide-se ainda em planejamento global para geração de rotas aproximadas e planejamento local para evitar obstáculos em tempo real e alcançar pontos de referência intermediários. Embora os modelos de base tenham demonstrado promessa em integrar modelos menores para lidar com tarefas mais amplas, o número ótimo de modelos e sua integração eficaz para navegação abrangente permaneceu uma questão em aberto.
O Astra da ByteDance, detalhado no artigo “Astra: Rumo a Robôs Móveis de Propósito Geral via Aprendizado Multimodal Hierárquico” (site: https://astra-mobility.github.io/), aborda essas limitações. Seguindo o paradigma Sistema 1/Sistema 2, o Astra apresenta dois submodelos principais: Astra-Global e Astra-Local. O Astra-Global lida com tarefas de baixa frequência, como localização de alvo e auto-localização, enquanto o Astra-Local gerencia tarefas de alta frequência, como planejamento de trajetória local e estimativa de odometria. Essa arquitetura promete revolucionar a forma como os robôs navegam em espaços internos complexos. O Astra-Global serve como o núcleo inteligente da arquitetura Astra, responsável por tarefas críticas de baixa frequência: auto-localização e localização de alvo. Ele funciona como um Modelo de Linguagem Multimodal Grande (MLLM), apto a processar tanto entradas visuais quanto linguísticas para alcançar uma posição global precisa dentro de um mapa.
Sua força reside em utilizar um gráfico topológico-semântico híbrido como entrada contextual, permitindo que o modelo localize posições com precisão com base em imagens de consulta ou prompts de texto. A construção desse sistema de localização robusto começa com mapeamento offline. A equipe de pesquisa desenvolveu um método offline para construir um gráfico topológico-semântico híbrido G=(V,E,L): Na prática, as capacidades de auto-localização e localização de alvo do Astra-Global utilizam um processo de duas etapas de grossa para fina para localização visual-linguagem. A etapa grossa analisa imagens de entrada e prompts de localização, detecta marcos, estabelece correspondência com um mapa de marcos pré-construído e filtra candidatos com base na consistência visual. A etapa fina usa a imagem de consulta e a saída grossa para amostrar nós do mapa de referência do mapa offline, comparando suas informações visuais e posicionais para produzir diretamente a pose prevista.
Para localização de alvo baseada em linguagem, o modelo interpreta instruções de linguagem natural, identifica marcos relevantes usando suas descrições funcionais dentro do mapa e, em seguida, utiliza mecanismos de associação de marco para nó para localizar nós relevantes, recuperando imagens de alvo e poses 6-DoF. Para dotar o Astra-Global de capacidades de localização robustas, a equipe empregou uma metodologia de treinamento meticulosa. Usando Qwen2.5-VL como espinha dorsal, combinaram Treinamento Fino Supervisionado (SFT) com Otimização de Política Relativa de Grupo (GRPO). O SFT envolveu conjuntos de dados diversificados para várias tarefas, incluindo localização grossa e fina, detecção de co-visibilidade e estimativa de tendência de movimento. Na fase GRPO, uma função de recompensa baseada em regras (incluindo formato, extração de marcos, correspondência de mapa e recompensas de marcos extras) foi usada para treinar a localização visual-linguagem. Experimentos mostraram que o GRPO melhorou significativamente a generalização de zero-tiro do Astra-Global, alcançando 99,9% de precisão de localização em ambientes domésticos não vistos, superando os métodos apenas SFT.
O Astra-Local atua como o assistente inteligente para as tarefas de alta frequência do Astra, uma rede multi-tarefa capaz de gerar eficientemente caminhos locais e estimar com precisão a odometria a partir de dados de sensores. Sua arquitetura compreende três componentes principais: um codificador espácio-temporal 4D, uma cabeça de planejamento e uma cabeça de odometria. O codificador espácio-temporal 4D substitui os móveis tradicionais, permitindo uma representação mais eficaz dos dados de sensores e melhor