Núcleo TokenSpeed

O TokenSpeed-kernel é um subsistema autônomo e de código aberto projetado para resolver a complexidade de backend na inferência de LLM (Modelos de Linguagem Grande). Ele introduz uma API limpa e um sistema de registro que desacopla o tempo de execução de alto nível do código de hardware específico de baixo nível. Neste artigo, fornecemos uma quebra técnica do TokenSpeed-kernel e mostramos como ele ajuda os desenvolvedores a trabalhar com núcleos de alto desempenho para inferência de LLM multi-silício. Os modelos de LLM e o hardware de inferência estão evoluindo a uma velocidade impressionante. Servir esses modelos de forma eficiente não é mais apenas uma questão de encontrar um núcleo de atenção ou MoE rápido; os motores de inferência modernos precisam se mover rapidamente entre modelos, formatos de quantização, gerações de GPU e backends de fornecedores sem transformar o tempo de execução em um labirinto de casos especiais. Essas APIs são agnósticas de plataforma e solução.

Essa é a motivação por trás do TokenSpeed-kernel: fornecer uma API limpa e estruturada para flexibilidade máxima. A interface entre o núcleo e o tempo de execução permanece genérica, enquanto os desenvolvedores de núcleos obtêm estrutura suficiente para se especializar profundamente em cada plataforma. Utilizamos o GPT-OSS como um exemplo concreto para demonstrar esse design na prática. O tempo de execução chama as mesmas APIs públicas do TokenSpeed-kernel, independentemente da plataforma; os caminhos AMD e NVIDIA obtêm seu desempenho a partir de núcleos plugáveis atrás dessas APIs. Para o GPT-OSS 120B da AMD, essa abordagem alcança o desempenho de ponta usando núcleos Gluon, mostrando que a estratificação não compromete o desempenho do backend.

O resultado é uma divisão clara de foco: os núcleos decidem se uma pilha de serviço é rápida ou lenta. A atenção, roteamento MoE, expert GEMMs, comunicação, quantização e amostragem todas executam em núcleos, e esses núcleos definem a latência, o throughput e a eficiência de hardware de todo o sistema. A parte difícil é que “o melhor núcleo” raramente é uma resposta fixa. Ele depende da arquitetura do modelo, forma do tensor, formato de quantização, geração de GPU, disponibilidade de bibliotecas de fornecedores, restrições de implantação e se uma chamada está servindo tráfego de decodificação ou preenchimento. Com o tempo, os motores acumulam caminhos para cobrir tudo isso: núcleos internos, wrappers de bibliotecas de fornecedores, núcleos experimentais, caminhos rápidos específicos de arquitetura e fallbacks históricos. Sem um sistema de núcleo claro e um limite rígido em torno dele, a lógica de seleção de backend vaza para o código do modelo e o código do tempo de execução.

Essa vazamento é custoso. Adicionar um novo modelo pode exigir tocar em caminhos de tempo de execução não relacionados. Adicionar um novo alvo de silício pode significar passar verificações de dispositivo por meio de camadas de modelo. O desenvolvimento de núcleos se torna mais difícil porque o comportamento do modelo, a dispatch do tempo de execução, a seleção de backend e os detalhes de implementação do núcleo estão interligados atrás de um limite não claro. O TokenSpeed-kernel é projetado para manter essa complexidade em um lugar. O sistema de núcleo é construído em torno de três princípios práticos: primeiro, o suporte a multi-silício deve ser fundamental. O sistema de núcleo deve entender as capacidades da plataforma diretamente, em vez de tratar verificações de hardware como condicionais dispersos.

O mesmo operação pode ter várias soluções para diferentes alvos de silício; todas devem competir por meio de um sistema de seleção. Em segundo lugar, a portabilidade e o desempenho devem coexistir. Um novo modelo precisa de um caminho portátil para executar em diferentes alvos de silício o mais rápido possível, e então pode gradualmente adquirir núcleos mais otimizados. O TokenSpeed-kernel mantém caminhos portáteis Triton ao lado de opções focadas no desempenho: Gluon para AMD, CuteDSL para NVIDIA e wrappers de fornecedores onde eles são a ferramenta certa. Em terceiro lugar, a iteração rápida de núcleo precisa de guardrails. O desenvolvimento de núcleo se move rapidamente quando o caminho da ideia à adoção é curto. O TokenSpeed-kernel mantém esse loop apertado com dependências leves, benchmarks e perfilamento autônomo que tornam os núcleos selecionados visíveis.

A mesma estrutura fornece ao desenvolvimento de núcleo para agentes de IA uma fronteira de trabalho mais clara: tente um núcleo, verifique-o, faça benchmarks e registre-o sem reformatar o código do modelo. O TokenSpeed-kernel também revisita ativamente as dependências que complicam as compilações ou bloqueiam a iteração, cortando-as ou isolando-as quando necessário. Esses princípios levam a um design em camadas. Em um alto nível, o sistema de núcleo em camadas é mostrado no diagrama a seguir. De cima para baixo, a pilha separa o que o tempo de execução solicita do modo como cada backend executa isso. O tempo de execução entra por meio de uma API pública genérica, o seletor mapeia essa solicitação para um núcleo compatível.

O TokenSpeed-kernel expõe essa estrutura de forma clara, permitindo que os desenvolvedores trabalhem com núcleos de alto desempenho para inferência de LLM multi-silício de forma eficiente. Com essa abordagem, os desenvolvedores podem se concentrar em criar modelos de LLM mais avançados, sabendo que o TokenSpeed-kernel cuidará da complex