Apenas 5% das empresas que investem em inteligência artificial generativa chegaram à produção com impacto financeiro mensurável, segundo levantamento do MIT. A distância entre demonstrar e operar tem causas identificáveis, e nenhuma delas está na qualidade do modelo
O relatório State of AI in Business 2025, produzido pela iniciativa NANDA, do Instituto de Tecnologia de Massachusetts, mapeou o percurso do investimento corporativo em inteligência artificial generativa e encontrou um funil íngreme. Cerca de 80% das organizações analisadas experimentaram ferramentas do tipo, aproximadamente 20% avançaram para pilotos estruturados e somente 5% chegaram à produção com retorno financeiro mensurável, apesar de aportes globais estimados entre US$ 30 bilhões e US$ 40 bilhões.
A Gartner chega a um diagnóstico convergente por outro caminho: projeta que mais de 40% dos projetos de inteligência artificial agêntica sejam cancelados até o fim de 2027, por custos crescentes, valor de negócio pouco claro e controles de risco inadequados. Em seu ciclo de expectativas de 2026, a consultoria registra que apenas 17% das organizações efetivamente implantaram agentes, enquanto mais de 60% pretendem fazê-lo em dois anos.
Os dois levantamentos medem coisas diferentes, mas descrevem o mesmo trajeto: os projetos não morrem na experimentação, morrem na travessia entre o piloto que convence e o sistema que opera. Para Guilherme Friol, CEO da Vircos, empresa de engenharia de inteligência artificial corporativa, essa travessia é o ponto cego do mercado. A distância entre uma demonstração bem-sucedida e um sistema em operação não é de capacidade do modelo, é de engenharia em torno dele.
“A demonstração mostra o sistema acertando. A operação é definida pelo que acontece quando ele erra, e essa parte quase nunca está no projeto”, afirma Friol.
A frase resume o critério que ele aplica para avaliar se um projeto está pronto para sair do piloto. São quatro componentes que a demonstração não exige e a operação cobra: tratamento de erro, escalonamento humano, monitoramento e isolamento da regra de negócio. Nenhum dos quatro aparece quando o sistema acerta. Todos definem o que acontece quando ele erra.
O primeiro, tratamento de erro, responde à pergunta mais básica da operação: o que o sistema faz quando não tem confiança na resposta, quando o dado de entrada vem incompleto ou quando a integração com outro sistema falha. Em ambiente de demonstração, esses casos não aparecem, porque os exemplos são escolhidos.
O segundo é o escalonamento humano. Processos que envolvem decisão precisam de um caminho definido para transferir o caso a uma pessoa, com o contexto preservado e com registro do motivo. Sem esse desenho, o sistema ou trava a operação ou decide sozinho o que não deveria.
O terceiro é o monitoramento. Sem medição contínua de qualidade da resposta e de custo por operação, a degradação só é percebida quando um cliente reclama ou quando a fatura chega fora do esperado.
O quarto é o mais estrutural. Sistemas de inteligência artificial em produção mudam de comportamento sem que o cliente altere nada, porque o modelo por trás deles é atualizado pelo provedor. Uma arquitetura preparada para operação isola a regra de negócio da tecnologia que a executa, de forma que a troca de um modelo não exija reconstruir o processo.
O próprio estudo do MIT traz um dado que costuma ser lido como argumento contra construir: iniciativas conduzidas em parceria com fornecedores especializados apresentaram taxa de sucesso aproximadamente duas vezes maior do que construções internas. Friol faz uma distinção sobre o que o número de fato compara.
“O estudo não compara comprar com construir. Compara quem tem engenharia no projeto com quem não tem. Construção interna sem time especializado falha mais mesmo, e é por isso que existe engenharia externa”, diz o executivo.
Os quatro componentes também explicam a diferença de orçamento que costuma travar projetos. Um piloto custa pouco e entrega rápido justamente porque não inclui nenhum deles. A conta da operação inclui todos, e a diferença entre os dois orçamentos costuma ser interpretada como sobrepreço, quando é, na verdade, a descrição do que separa uma demonstração de um sistema em uso.
O ajuste que se desenha para os próximos anos, segundo Friol, é de critério de avaliação. Enquanto o sucesso de uma iniciativa de inteligência artificial for medido pela demonstração que convence o comitê, o funil descrito pelo MIT tende a permanecer onde está. Medir pela operação estável em ambiente real reduz o número de projetos aprovados e aumenta a proporção dos que chegam ao fim.





