Gemma 4
O desenvolvimento de agentes de inteligência artificial (IA) com a capacidade de chamar funções é uma das principais inovações da tecnologia Gemma 4. Imagine poder perguntar ao seu modelo de IA: “Qual é o clima em Tóquio agora?” e, em vez de fornecer uma resposta errada, o modelo chame uma função Python real, obtenha dados em tempo real e responda corretamente. É assim que as funções de chamada de ferramentas do Gemma 4 são empoderadoras. Uma adição emocionante à IA de peso aberto: essas funções de chamada são estruturadas, confiáveis e construídas diretamente no modelo de IA! Couplada com Ollama para referências locais, permite desenvolver agentes de IA que não dependem de nuvem. O melhor de tudo: esses agentes têm acesso a APIs e serviços do mundo real localmente, sem necessidade de assinatura. Neste guia, vamos cobrir o conceito e a arquitetura de implementação, bem como três tarefas que você pode experimentar imediatamente.
Os modelos de linguagem conversacional têm um conhecimento limitado com base no momento em que foram desenvolvidos. Portanto, eles podem oferecer apenas uma resposta aproximada quando você pergunta sobre preços de mercado atuais ou condições climáticas atuais. Essa limitação foi abordada fornecendo um invólucro de API em torno de modelos comuns (funções). O objetivo é resolver esse tipo de pergunta por meio de serviços de chamada de ferramentas. Ao habilitar a chamada de ferramentas, o modelo pode reconhecer: ele espera até que a execução do bloco de código retorne a saída e, em seguida, compõe uma resposta avaliada com base na saída recebida. Para esclarecer: o modelo nunca executa as chamadas de método criadas pelo usuário. Ele apenas determina quais métodos chamar e como estruturar a lista de argumentos da chamada de método. O código do usuário executará os métodos que foram chamados por meio da função da API. Nesse cenário, o modelo representa o cérebro de um ser humano, enquanto as funções chamadas representam as mãos.
Antes de começar a escrever código, é benéfico entender como tudo funciona. Aqui está o loop que cada ferramenta no Gemma 4 seguirá, conforme faz chamadas de ferramentas: é um padrão de duas etapas que é a base para todos os agentes de IA que chamam funções, incluindo os exemplos mostrados abaixo. Para executar essas tarefas, você precisará de dois componentes: Ollama deve ser instalado localmente na sua máquina e você precisará baixar o modelo Gemma 4 Edge 2B. Não há dependências além do que é fornecido com a instalação padrão do Python, portanto, você não precisa se preocupar em instalar pacotes Pip. Após baixar o modelo, use a lista Ollama para confirmar se ele existe na lista de modelos. Agora você pode se conectar à API em execução no URL http://localhost:11434 e executar solicitações contra ela usando a função de ajuda que criaremos: não são necessárias bibliotecas de terceiros; portanto, o agente pode ser executado de forma independente e fornece transparência completa.
O primeiro de nossos métodos usa open-meteo, que obtém dados em tempo real para qualquer localização por meio de uma API de clima gratuita que não precisa de uma chave para obter as informações até a área local com base nas coordenadas de longitude/latitude. Se você for usar essa API, precisará realizar uma série de etapas: isso fornece as informações ao modelo para que o Gemma 4 saiba exatamente o que a função fará/estará esperando quando for chamada. O modelo clássico de linguagem falha ao hallucinar valores de moeda e não ser capaz de fornecer conversões de moeda precisas e atualizadas. Com a ajuda da ExchangeRate-API, o conversor pode obter as taxas de câmbio estrangeiro mais recentes e converter com precisão entre duas moedas.
Uma vez que você complete as etapas 1-3 abaixo, terá um conversor totalmente funcional no Gemma 4: o Gemma 4 processará a consulta de linguagem natural e formatará uma chamada de API apropriada com base na quantidade = 5000, de = ‘INR’, para = ‘USD’. A chamada de API resultante será processada pelo mesmo método ‘Feedback’ descrito na Tarefa 01. O Gemma 4 se sai muito bem nessa tarefa. Você pode fornecer ao modelo várias ferramentas simultaneamente e enviar uma consulta composta. O modelo coordena todas as chamadas necessárias de uma vez; a chaining manual é desnecessária. Aqui, descrevemos três funções distintas com três APIs separadas em tempo real por meio do processamento de linguagem natural usando um conceito comum. Isso inclui toda a execução local sem soluções de nuvem a partir da instância do Gemma 4; nenhum desses componentes utiliza recursos remotos ou nuvem.
Outros modelos de peso aberto podem chamar ferramentas, mas não funcionam de forma confiável, e é isso que os diferencia do Gemma 4. O modelo fornece consistentemente argumentos JSON válidos, processa parâmetros opcionais corretamente e determina quando retornar conhecimento e não chamar uma ferramenta. À medida que você continua usando, lembre-se de que criou um agente de IA real que usa a função de chamada de ferramentas do Gemma 4 e está funcionando entirely localmente. O sistema baseado em agente usa todos os componentes da arquitetura em produção. Próximas etapas potenciais podem incluir: o ecossistema de agentes de IA de peso aberto está evoluindo. Com a capacidade de chamar funções, os agentes de IA podem se tornar mais inteligentes e capazes de realizar tarefas mais complexas. Isso pode levar a uma nova geração de aplicações de IA que podem ser usadas em uma variedade de campos, desde assistentes virtuais até sistemas de recomendação.
Além disso, a capacidade de chamar funções também pode ser usada para melhorar a seg