A Web Está Classificando Bots por Finalidade, Não por Comportamento
Todo sistema de detecção de bots criado nos últimos quinze anos faz uma única pergunta: este tráfego parece automatizado? Ordem de headers, fingerprints de rede, movimento do mouse, tempo de sessão. Tudo isso tenta deduzir algo sobre o cliente a partir do formato da request.
Em 1 de julho de 2026, a Cloudflare mudou a pergunta. O tráfego de bots agora se divide em três categorias que não têm relação com a aparência de uma request na rede. Search cobre "crawlers que indexam seu conteúdo para responder a perguntas sobre ele mais tarde". Agent cobre "atividade automatizada agindo em tempo real em nome de uma pessoa". Training cobre "crawlers que coletam seu conteúdo para treinar ou fazer fine-tuning de um modelo".
Imagine três requests chegando ao mesmo servidor. Mesmo cliente, mesmos headers, mesmo timing, idênticas até o último byte. Sob esse modelo, elas podem receber três vereditos diferentes, decididos inteiramente pelo que você planeja fazer com a página após o recebimento.
Isso não é um detector melhor. É uma primitiva diferente.
O Prazo de 15 de Setembro É Mais Restrito do que o Pânico
A versão dessa história que circula em fóruns de desenvolvedores é que a Cloudflare bloqueará agentes de IA em um quinto da web em 15 de setembro.
O changelog diz algo bem mais contido. Os novos padrões se aplicam a "novos domínios integrados à Cloudflare". Nesses domínios, "bots classificados como Training ou Agent são bloqueados em páginas que exibem anúncios, enquanto Search continua permitido". Quem já está na Cloudflare escolhe sua própria configuração e pode fazer isso a qualquer momento antes da data.
Portanto: apenas novos domínios, apenas páginas com anúncios, e uma das três categorias ainda passa por padrão. É uma mudança real, mas não é um bloqueio total na internet.
Mas o escopo restrito é a parte interessante. A Cloudflare não publicou uma política, publicou um padrão, e padrões são a forma como uma política se torna a norma sem que ninguém vote nela. O número que vale a pena observar não é 15 de setembro. É quantos desses domínios nunca alteram essa configuração depois.
O que isso significa: se você coleta dados, a pergunta útil deixou de ser "consigo passar pela proteção deste site" e passou a ser "em qual categoria este site acha que eu estou". Elas têm respostas diferentes e apenas uma delas pode ser testada.
A Finalidade Não Pode Ser Medida. Ela Precisa Ser Declarada.
Aqui está o problema mecânico de classificar o tráfego por intenção: a intenção não está no pacote.
Uma fingerprint pode ser medida. O movimento do mouse pode ser medido. "Por que você está buscando esta página" não pode, então o sistema precisa que o cliente diga isso explicitamente, e precisa de um motivo para acreditar na resposta. Esse é o papel do Web Bot Auth. O agente assina suas requests com uma chave privada, publica um diretório de chaves, e o edge verifica a assinatura com base nisso, construído sobre RFC 9421 HTTP Message Signatures. A documentação da Cloudflare define o critério para um bot verificado como "autoidentificação honesta."
Agora veja o que está aplicando isso em escala. A especificação é draft-meunier-webbotauth-httpsig-protocol-02, revisada pela última vez em 18 de agosto de 2026. Status pretendido: Standards Track. Status real: um "Active Internet-Draft (individual)" que "não é endossado pelo IETF" e não possui "nenhum status formal no processo de padrões do IETF." Ela tem dois autores. Um trabalha na Cloudflare, o outro trabalha no Google.
Acreditamos que o design está correto, e vale a pena dizer isso antes de trazer as críticas. Identidade assinada supera a corrida armamentista das páginas de verificação para quem pretende se comportar bem. Um crawler que se identifica pode ser permitido, sofrer rate limit ou ser faturado de forma intencional em vez de estimada, e os proprietários dos sites ganham um controle que não atinge visitantes reais como dano colateral. Compare isso a uma década bloqueando faixas de IP e torcendo pelo melhor.
O que ele não pode fazer é parar alguém. Um sistema construído sobre propósito declarado apenas classifica o tráfego que se declara. Todo o restante recai na stack de detecção que já existia antes, e essa stack continua ficando mais afiada: a pontuação comportamental com escopo de sessão da Cloudflare foi lançada doze dias após as novas categorias.
Portanto, as duas não competem entre si. A identidade classifica os honestos, a detecção lida com todos os outros, e essa segunda opção é onde seu tráfego vai parar por padrão se você nunca declarar nada.
Não Há Categoria para Coleta de Dados Públicos
Agora a parte que deveria incomodar qualquer pessoa que opera um pipeline de coleta.
Veja os trabalhos que publicamos este ano. Um índice de preços de madeira construído a partir de listagens públicas. Detecção de violação de MAP em seis marketplaces, o que significa buscar a mesma página de produto a partir de seis pontos de vista diferentes e comparar o que cada uma exibe. Rankings em app stores e sentimento de reviews. Verificações de veiculação de anúncios executadas a partir do país onde a campanha foi realmente comprada.
Classifique esses casos em Search, Agent ou Training.
Search não se encaixa: a própria definição da Cloudflare inclui uma expectativa de "tráfego de referência ou outra compensação equivalente em troca", e uma verificação noturna de preços não envia referências para ninguém. Agent também não se encaixa, porque nenhum humano está sentado na frente de uma tela esperando por esse fetch. E Training está claramente errado, já que nada é absorvido por um modelo.
Esta é uma taxonomia criada para descrever o tráfego de IA que surgiu nos últimos três anos, agora aplicada a um modelo de negócios que a antecede em uma década. Inteligência de preços, dados alternativos, rastreamento de SERP, proteção de marca, verificação de anúncios, monitoramento de conformidade: nada disso é novo, nada disso é agêntico e nada disso tem uma caixa de seleção própria.
O tráfego sem uma categoria definida acaba sendo classificado por quem desenhou as categorias. Geralmente, na mais próxima.
O que isso significa para equipes de dados
Quatro medidas que valem a pena tomar enquanto as regras ainda são flexíveis.
Decida qual categoria você reivindicaria honestamente. Não aquela que apenas garante a sua entrada. Aquela que você defenderia por escrito se um publisher perguntasse diretamente a você. Se a resposta honesta for "nenhuma destas", você está no grupo que tem mais a perder quando a taxonomia se consolidar, e mais a ganhar ao se posicionar enquanto ainda há espaço para discussão.
Leia as configurações do alvo, não as manchetes. A política de bots de um site agora é uma propriedade específica daquele site, configurável por path, e muda sem aviso prévio. Tratar "a Cloudflare bloqueia agents em setembro" como um fato absoluto sobre o seu pipeline fará você reconstruir partes da infraestrutura que nunca estiveram em risco.
Assuma que o teste de páginas de anúncios vai se expandir. A Cloudflare vinculou seu padrão a páginas que exibem anúncios, um bom proxy para "esta página monetiza a atenção humana". Essa linha vai mudar, e a Cloudflare não é a única a traçá-la. O AWS WAF lançou a monetização de tráfego de IA em 15 de junho de 2026, respondendo com um status 402 e termos de pagamento legíveis por máquina. A Akamai seguiu o caminho de parcerias com TollBit e Skyfire. Três dos maiores provedores de edge agora vendem a mesma superfície de controle, a qual analisamos sob a perspectiva de preços quando o modelo de pagamento por rastreamento foi lançado.
Mantenha sua coleta capaz de operar em qualquer uma das vias. A via identificada (assinar, declarar, ser liberado ou ser faturado) e a não identificada (ser avaliado por comportamento, como sempre) coexistirão por anos. Desenvolver arquiteturas como se apenas uma delas existisse é o erro mais caro aqui, em ambas as direções.
As caixas serão redesenhadas
Uma previsão que sustentamos com confiança: uma quarta categoria surgirá dentro de um ano.
A primeira versão de qualquer taxonomia é escrita por quem está sob pressão, e as pessoas que estão sendo classificadas não estão na sala quando isso acontece. Search, Agent e Training descrevem o que as empresas de IA fazem com os publishers. Eles não descrevem uma empresa de pesquisa de mercado, uma equipe de compliance ou um varejista verificando o preço de prateleira de um concorrente, e esses três já coletavam páginas públicas de forma educada antes de "agent" significar qualquer coisa nesse contexto.
A disputa sobre como essa quarta opção será chamada, e quem poderá marcá-la, importará mais para o setor de dados do que qualquer benchmark de detecção de bots publicado este ano. Vale a pena marcar presença nessa.
Porque a alternativa padrão é bastante simples. Se o seu tráfego não puder se identificar, outra pessoa o fará por você.