Não existe uma definição padrão. Harness de IA e harness de agente geralmente significam o runtime ao redor de um modelo que usa ferramentas. Alguns desenvolvedores usam o termo mais amplo para quase tudo em uma aplicação de IA, exceto o próprio modelo.
Como funciona um harness de IA
Um modelo aceita uma entrada e produz uma saída. Por si só, ele não decide como uma aplicação armazena uma conversa, se uma ação solicitada é permitida ou o que deve acontecer depois que uma ferramenta falha. O harness cuida dessas tarefas.
Um harness típico repete quatro etapas:
- Preparar a entrada do modelo. O harness combina a solicitação do usuário com instruções e as informações necessárias para esta rodada. Ele pode carregar o estado da conversa, recuperar um documento ou descrever as ferramentas que o modelo pode solicitar.
- Chamar o modelo. Ele envia essa entrada a um provedor de modelos e recebe texto ou uma solicitação estruturada.
- Interpretar e controlar a saída. Se o modelo solicitar uma ferramenta, o harness verifica se a ferramenta existe, valida seus argumentos e aplica permissões ou regras de aprovação. Se a saída precisar corresponder a um formato, o harness também a valida.
- Retornar, agir ou continuar. O harness pode mostrar uma resposta final, executar uma ação permitida ou devolver o resultado de uma ferramenta ao modelo para outra rodada. Ele também impõe condições de parada, como um limite de rodadas ou um tempo limite.
Nem todo harness inclui todos os recursos. Um serviço simples de sumarização pode apenas montar uma entrada, chamar um modelo, validar a resposta e retorná-la. Um harness de programação também pode fornecer arquivos, um executor de comandos, estado persistente, resultados de testes, aprovações humanas e registros de todas as ações.
A divisão fundamental é esta: o modelo propõe uma saída, enquanto o harness determina o que essa saída pode fazer. Um modelo pode produzir uma solicitação para enviar um e-mail, mas o código comum da aplicação no harness autentica o usuário, verifica o destinatário, solicita aprovação se necessário, chama o serviço de e-mail e informa o resultado.
Exemplo: um assistente de reembolso
Suponha que um cliente escreva: “Por favor, reembolse os fones de ouvido do pedido 4812.”
Primeiro, o harness envia a solicitação ao modelo com instruções e descrições de duas ferramentas disponíveis: get_order e issue_refund. O modelo solicita chamar get_order com o número do pedido 4812.
O harness verifica se o argumento tem o formato esperado e se o cliente pode acessar esse pedido. Ele executa a consulta e fornece o resultado ao modelo. O resultado informa que os fones de ouvido custaram US$ 80 e ainda estão elegíveis para reembolso.
Em seguida, o modelo solicita issue_refund no valor de US$ 80. Antes que o dinheiro seja movimentado, o harness verifica a política de reembolso e a identidade do cliente. Se a política da empresa exigir aprovação, ele pausa e mostra a ação proposta a um funcionário. Somente após a aprovação o harness chama o sistema de pagamentos.
O modelo ajudou a escolher as etapas. O harness ficou responsável pelas partes com consequências: acesso aos dados, validação, aplicação da política, aprovação, execução e registro do que aconteceu.
Essa separação também facilita o tratamento de falhas. Se o serviço de pedidos atingir o tempo limite, o harness pode tentar novamente uma vez e depois interromper com um erro claro. Ele não precisa torcer para que o modelo invente um plano seguro de recuperação.
Por que o harness é importante
O mesmo modelo pode se comportar de maneiras muito diferentes em dois harnesses. Um pode fornecer descrições claras das ferramentas, contexto relevante, permissões rigorosas e mensagens de erro úteis. Outro pode sobrecarregá-lo com informações irrelevantes, expor ferramentas arriscadas e ocultar falhas. A qualidade do modelo é importante, mas não descreve o comportamento do sistema completo.
Os harnesses também são o local onde os desenvolvedores podem impor regras, em vez de apenas pedir que elas sejam seguidas. Uma instrução como “nunca reembolse mais de US$ 100 sem aprovação” pode influenciar um modelo, mas não é um controle confiável. Uma verificação no nível do código que bloqueia a chamada de pagamento pode ser aplicada mesmo quando o modelo comete um erro ou quando um texto não confiável tenta redirecioná-lo.
Um harness bem definido também facilita inspecionar e alterar uma aplicação. Os registros podem mostrar as entradas, as solicitações de ferramentas, as aprovações, os resultados e o motivo da parada de uma execução. Às vezes, um modelo pode ser substituído sem reconstruir todas as integrações ao redor, embora ainda seja necessário testar prompts específicos do modelo e o comportamento das ferramentas.
Um harness nem sempre é um agente
Um harness é uma camada de um sistema. Um agente geralmente é o sistema completo que usa um modelo para escolher ações ao longo de uma ou mais etapas.
Isso significa que um harness pode existir sem muita autonomia. O software por trás de uma interface de chat básica ainda gerencia instruções, histórico de mensagens, chamadas ao modelo e a saída exibida. Essas são funções de harness, mesmo que o modelo não possa usar ferramentas nem realizar uma tarefa por conta própria.
O inverso não é verdadeiro para um agente implantado. Um modelo não pode autenticar-se diretamente em um banco de dados, aplicar uma política de aprovação ou preservar o estado de uma tarefa depois que um processo é reiniciado. O software ao redor do modelo precisa fornecer esses recursos, independentemente de os desenvolvedores chamarem esse software de harness.
O termo também aparece em harness de avaliação. Nesse contexto, um harness executa modelos em um conjunto consistente de tarefas de teste e registra as pontuações. É um sistema de testes, não necessariamente o runtime de um agente. O contexto geralmente indica qual significado se pretende.
O que ler em seguida
Leia O que é um agente de IA? para ver como um modelo e um harness podem formar um sistema que escolhe e executa várias etapas. Leia O que é uso de ferramentas em LLMs? para conhecer o ciclo de proposta, validação, execução e observação controlado por um harness. Para entender os limites entre as principais camadas, consulte Modelo de IA vs. chatbot vs. harness vs. agente.