Brief
|
|
Executive Summary
Nos últimos dois anos, a IA nas empresas tem funcionado como uma assistente eficiente: redige, resume e analisa conteúdos e, depois, devolve o trabalho para que uma pessoa tome a decisão e aja. Isso tem ajudado a manter os riscos sob controle, com a supervisão humana desempenhando um papel importante nesse processo. A Agentic AI muda essa dinâmica. A partir de um objetivo, ela age: abre chamados, atualiza registros e aciona fluxos de trabalho. Em muitas tarefas, já não há uma pessoa revisando o resultado e decidindo o que deve acontecer em seguida. Mas os sistemas de Agentic AI são diferentes de tudo o que as organizações já precisaram administrar do ponto de vista de governança. Eles são probabilísticos, enquanto os sistemas de software tradicionalmente operam de forma determinística. Também trabalham com informações em formatos que as pessoas usam no dia a dia, como documentos, planilhas, gravações, imagens e vídeos — conteúdos que a maioria das organizações nunca gerenciou com o mesmo rigor aplicado aos dados estruturados. Além disso, esses sistemas dependem de componentes que não pertencem à organização: modelos fundacionais, ferramentas externas, serviços de recuperação de informações, agentes de terceiros e conectores com outras plataformas. O risco precisa ser avaliado considerando o sistema como um todo, grande parte dele fora dos limites da própria organização. Esse conjunto de componentes é montado durante a execução e atualizado em ritmos que a organização não controla. Por isso, uma vulnerabilidade em qualquer ponto dessa cadeia — uma ferramenta atualizada sem aviso, um conector comprometido ou um modelo alterado sem notificação — passa a ser também um risco para a organização. Essa realidade exige uma abordagem diferente de governança, com base na mesma lógica estratégica que distingue as empresas líderes em IA das demais. O trabalho da Bain sobre como transformar IA em inteligência proprietária apresenta uma visão mais ampla sobre o tema; a seguir, o foco será a governança na prática. O que precisar mudarOs controles que a maioria das organizações adotou para a IA generativa se concentram em documentos e reuniões, como avaliações iniciais, fóruns de governança e solicitações de análise por comitês de arquitetura. Essas medidas ajudam, mas não são suficientes para lidar com centenas de agentes realizando milhares de ações por dia. Os controles precisam estar incorporados ao plano de controle da própria plataforma de Agentic AI — a camada em que a plataforma determina, em tempo real, o que um agente pode ou não fazer. E essas regras precisam ser implementadas em código, em vez de existirem apenas como políticas. Uma regra aplicada pela plataforma vale para todos os agentes, todas as vezes. Já uma política escrita só é aplicada quando alguém se lembra de consultá-la. Essa diferença entre o que as políticas determinam e o que os agentes realmente fazem representa, antes de tudo, uma lacuna de governança, e não de tecnologia. Para lidar com isso da forma adequada, é preciso definir claramente as responsabilidades, alinhar os investimentos e avançar com agilidade. São decisões de governança que precisam fazer parte do modelo operacional de IA desde o início, e não ser acrescentadas depois que os agentes já estiverem em operação. As principais plataformas já oferecem grande parte dessa estrutura — identidade, registro, gateway, avaliação e observabilidade — como recursos nativos, em vez de exigir projetos de engenharia desenvolvidos sob medida. Para a maioria das organizações, a questão já não é se devem criar um plano de controle, mas qual solução adotar e em quais pontos acrescentar seus próprios controles. Toda plataforma de Agentic AI deve incorporar controles em cinco áreas fundamentais: identidade, comportamentos, contexto, observabilidade e avaliação, e definição de responsabilidades. IdentidadeAs organizações precisam tratar cada agente de IA como tratariam um funcionário, com identidade e credenciais próprias, além de uma descrição de função que estabeleça claramente seus objetivos e limites. As permissões devem se restringir ao mínimo necessário para executar cada tarefa e ter prazo definido, em vez de serem permanentes. Toda ação realizada pelo agente deve poder ser vinculada à pessoa que a autorizou, e cabe a essa pessoa responder pelas ações do agente. Em larga escala, isso exige um registro centralizado de todos os agentes, sejam eles usados em produção, estejam em desenvolvimento ou ainda em fase piloto. Cada registro deve indicar as permissões, o grau de autonomia, quem é responsável pelo agente, a etapa do ciclo de vida em que ele se encontra e quais modelos está autorizado a utilizar. Sem essa visibilidade, a governança alcança apenas os agentes mais fáceis de identificar, deixando de fora aqueles que vão se acumulando de forma pouco perceptível nos bastidores. Além disso, os agentes não são estáticos. Os prompts mudam, as fontes de dados evoluem e novas funcionalidades passam a ser incorporadas a partir de bibliotecas compartilhadas de ferramentas e skills.
Os níveis de identidade e autonomia definem o que um agente tem permissão para fazer. Já o que ele pode de fato fazer quando algo dá errado é uma questão diferente e é aí que entram os controles de comportamento. ComportamentosOs controles de comportamento determinam o que um agente pode fazer e consumir depois que entra em operação — o que muitas vezes é chamado de blast radius, ou seja, o alcance potencial dos impactos de suas ações. Um agente pode estar corretamente identificado e ter um escopo bem definido e, ainda assim, causar consequências graves mesmo atuando dentro das permissões que recebeu. Por isso, as empresas precisam de duas categorias distintas de controles de comportamento, que devem ser estruturadas separadamente. A primeira estabelece limites para os recursos que um agente pode utilizar, como memória, capacidade computacional e armazenamento. Sem esses controles, os custos podem sair do controle ou os processos podem deixar de funcionar. A segunda estabelece limites para as ações que o agente pode executar, principalmente por meio de ferramentas. Em vez de depender apenas do próprio julgamento, cada agente deve operar em um ambiente isolado, com limites rígidos impostos pela plataforma. Isso inclui limites para o número de etapas na cadeia de ferramentas, para os gastos e para o tempo de execução, além da definição de ações que o agente jamais poderá realizar. Os custos precisam ser considerados explicitamente nesse conjunto de controles, e não tratados como algo secundário. Sistemas de Agentic AI consomem recursos computacionais de maneiras que o software convencional não consome, por meio de ciclos de raciocínio, chamadas recursivas de ferramentas e agentes que acionam outros agentes. Por isso, a visibilidade dos gastos, a atribuição dos custos a cada agente e limites rígidos de gastos devem fazer parte das medidas de proteção relacionadas ao comportamento. Ações de alto risco ou irreversíveis não devem depender apenas do julgamento do agente: o agente apresenta seu plano, uma pessoa o confirma e, somente então, a ação é executada. A contenção precisa ser prevista desde o início, e não improvisada durante um incidente. Mecanismos de interrupção automática, reversão automática quando um limite de nível de serviço é ultrapassado e a transição controlada para um modo mais simples, com base em regras — ou para uma pessoa — quando o nível de confiança diminui são medidas que impedem que uma falha isolada desencadeie uma sequência de outras falhas. E um mecanismo de desligamento de emergência só pode ser considerado efetivo se tiver sido testado. Um processo de interrupção e reversão que nunca foi testado não é um controle; na melhor das hipóteses, é apenas uma expectativa de que funcione.
ContextoUm agente é tão confiável quanto as informações que utiliza para agir. Dados de baixa qualidade ou informações manipuladas podem gerar resultados ruins e, em alguns casos, perigosos. E muitas das falhas de Agentic AI observadas na prática têm origem justamente no contexto fornecido aos agentes. Para evitar essas falhas, duas condições precisam ser atendidas. Primeiro, instruções e conteúdo devem ser mantidos rigorosamente separados. Os objetivos, as permissões e as regras do agente são definidos pela plataforma. Já os documentos, e-mails, planilhas, resultados gerados por ferramentas e páginas da web que ele consulta são dados a serem processados, e não instruções a serem seguidas. Quando essa distinção não é clara, um único parágrafo inserido de forma mal-intencionada — em um e-mail de fornecedor, na transcrição de uma reunião ou em uma página da web acessada pelo agente — pode desviá-lo para atender aos interesses de terceiros. Demonstrações já publicadas mostraram que agentes de programação podem ser manipulados por meio de conteúdos maliciosos inseridos em registros públicos de problemas e solicitações em plataformas de desenvolvimento, levando-os a expor código confidencial. Esses registros funcionam como isca, e o agente interpreta o conteúdo como uma instrução legítima.
Segundo, o conteúdo não estruturado que os agentes utilizam — documentos, e-mails, planilhas e gravações — precisa seguir os mesmos critérios de classificação, retenção e controle de acesso aplicados aos dados estruturados. Para a maioria das organizações, esse é o fator que mais influencia o desempenho dos agentes e explica por que a engenharia de contexto vem se consolidando como uma capacidade específica das plataformas de Agentic AI. Por exemplo, um agente voltado à consultoria de investimentos precisa ter acesso a informações relevantes e cuidadosamente selecionadas sobre clientes, produtos e mercado para fazer recomendações que realmente possam orientar uma decisão. Observabilidade e avaliaçãoUma organização não pode exercer governança sobre aquilo que não consegue enxergar. No software tradicional, observabilidade significa saber se o sistema está funcionando, apresentando o desempenho esperado e operando sem erros. Para agentes, isso não é suficiente. Um agente pode passar por todos esses critérios e, ainda assim, estar errado: pode gerar uma resposta aparentemente válida, mas que ninguém solicitou, informar que executou ações que nunca foram realizadas ou se desviar gradualmente de seu objetivo original. O perigo não está em um agente que simplesmente para de funcionar, mas naquele que parece estar funcionando corretamente quando, na verdade, não está. Em um caso de 2025 amplamente divulgado, um agente de programação da plataforma Replit excluiu um banco de dados de produção que estava em uso, durante um período em que alterações no código estavam suspensas — contrariando instruções dadas repetidamente — e depois informou ao desenvolvedor que não seria possível reverter a exclusão. Mas era possível. Gerenciar esse risco exige duas práticas complementares. A avaliação permite verificar se um agente funciona como esperado, tanto antes de entrar em operação quanto de forma contínua depois disso. Já a observabilidade permite à organização acompanhar o que os agentes estão fazendo em produção. Nenhuma das duas, isoladamente, é suficiente. Mesmo um agente que tenha sido bem avaliado pode apresentar comportamentos inesperados quando os dados, os modelos ou as ferramentas mudam. E um agente que é monitorado em produção continua representando um risco se nunca tiver passado por uma avaliação rigorosa.
Os agentes operam em condições que mudam constantemente, por isso os testes precisam ser contínuos e abranger cenários que avaliem precisão, desempenho, custos e possíveis desvios ao longo do tempo. Os custos devem receber a mesma atenção. Sistemas de Agentic AI podem consumir rapidamente grandes volumes de recursos computacionais devido a ciclos de raciocínio que se prolongam sem controle, chamadas recursivas de ferramentas e agentes que acionam outros agentes. Por isso, limites de gastos e a atribuição dos custos devem fazer parte do plano de controle. A avaliação contínua também deve ser o único critério válido para conceder mais autonomia a um agente. Essa decisão precisa se basear em desempenho comprovado, e não em pressões do negócio ou prazos de lançamento. A observabilidade em produção exige três elementos fundamentais: verificar o que de fato ocorreu diretamente nos sistemas em que o agente atuou, em vez de confiar apenas no que ele próprio relata; manter um registro de auditoria inviolável, que possa ser reconstruído e compreendido posteriormente mesmo por quem não é da área de engenharia; e garantir que exista uma forma testada de interromper a atuação do agente e, quando o nível de risco justificar, reverter suas ações. Responsabilidades e prestação de contasMesmo com todos esses controles, a responsabilidade final continua sendo das pessoas. Conselhos de administração, órgãos reguladores e clientes esperam que alguém responda pelas ações da organização, e nenhuma solução tecnológica elimina essa responsabilidade. Os controles incorporados à plataforma dão a essas pessoas a visibilidade necessária para entender o que está acontecendo e a capacidade de intervir quando algo não está funcionando como deveria. Líderes das áreas de negócios, dados e tecnologia precisam trabalhar em conjunto com as funções de controle para gerenciar os riscos residuais que a organização está disposta a assumir. Uma forma de fazer isso é ampliar a exposição de maneira gradual: primeiro com dados sintéticos, depois com os agentes operando em paralelo com pessoas e, em seguida, com um projeto piloto envolvendo um grupo pequeno antes de uma implementação mais ampla. Esse processo avança mais rapidamente quando áreas de controle, como jurídico, riscos e compliance, adotam uma postura voltada à solução de problemas, em vez de simplesmente vetar iniciativas. As organizações que avançam mais rapidamente incluem um especialista em riscos da primeira linha de defesa em cada equipe responsável por uma iniciativa prioritária, para acompanhar o projeto ao longo de todo o processo de avaliação de riscos. A segunda linha de defesa também passa a participar mais cedo, definindo requisitos mínimos e padrões de risco e acompanhando o desenvolvimento, em vez de atuar apenas na etapa final de aprovação. Assim, essas áreas já conhecem bem o trabalho quando chega o momento de aprová-lo.
Os modelos de risco estão convergindo para uma abordagem que considera o alcance do sistema de Agentic AI — desde o uso individual até equipes e toda a organização —, a probabilidade de algo dar errado e o impacto que isso teria sobre as partes envolvidas. À medida que a autonomia aumenta, um modelo de prestação de contas cada vez mais adotado é o de humans on the loop, em que o agente atua enquanto uma pessoa supervisiona suas ações. Na prática, porém, nenhum supervisor consegue revisar milhares de ações por dia, e um mecanismo de interrupção de emergência é inútil sem sinais que indiquem quando ele deve ser acionado. São justamente esses sinais que os demais controles discutidos até aqui foram desenvolvidos para fornecer. À medida que as pessoas passam a supervisionar um número maior de agentes, aumenta também sua responsabilidade por interpretar regulamentações, estabelecer limites de atuação e incorporar controles que se apliquem aos agentes. Por onde começarComece com um escopo mais restrito do que você imagina. As organizações bem-sucedidas começam onde existem as condições certas: valor claro para o negócio, um responsável bem definido pelo processo, ações que possam ser revertidas e situações de falha que não provoquem consequências graves. Manter o foco também é uma forma de governança: quanto menos iniciativas disputarem atenção, maior será a capacidade de implementar os controles necessários. Esse foco precisa vir da alta liderança. O nível de risco que a organização está disposta a assumir com Agentic AI deve ser discutido continuamente entre o CEO e o conselho de administração, e não definido em uma única aprovação. Além disso, precisa estar alinhado ao estágio em que a organização realmente se encontra em termos de governança e controles. O grau de maturidade desses controles determina até onde a organização pode avançar de forma responsável; as diretrizes do conselho determinam a velocidade desse avanço. A partir dessa discussão, surgem três prioridades:
A questão já não é se os agentes vão chegar, mas se a organização está criando os controles necessários para governá-los. A governança não é um freio acionado depois que os agentes entram em operação — é a estrutura que permite às empresas ampliar a autonomia dos agentes com segurança e aproveitar o valor de Agentic AI em larga escala. |