Todos os posts

Search, Agent, Training: As novas regras de bots da web

A Cloudflare agora classifica bots por finalidade, não por comportamento: Search, Agent ou Training. O padrão de 15 de setembro é mais restrito do que o pânico sugere, e falta uma opção.

A Web Está Classificando Bots por Finalidade, Não por Comportamento

Todo sistema anti-bot desenvolvido nos últimos quinze anos faz uma única pergunta: esse tráfego parece automatizado? Ordem de headers, impressões digitais no nível do protocolo, movimento do mouse, tempo de sessão. Tudo isso tenta inferir algo sobre o client a partir do formato da request.

Em 1º de julho de 2026, a Cloudflare mudou a pergunta. O tráfego de bots agora é classificado em três categorias que não têm nada a ver com a aparência de uma request na rede. Search abrange "crawlers que indexam seu conteúdo para responder a perguntas sobre ele mais tarde." Agent abrange "atividade automatizada agindo em tempo real em nome de uma pessoa." Training abrange "crawlers que capturam seu conteúdo para treinar ou ajustar um modelo."

Imagine três requests chegando ao mesmo servidor. Mesmo client, mesmos headers, mesmo timing, idênticas até o byte. Sob este modelo, elas podem receber três vereditos diferentes, decididos inteiramente pelo que você planeja fazer com a página após o recebimento.

Isso não é um detector melhor. É uma primitiva diferente.

O Prazo de 15 de Setembro É Mais Restrito do que o Pânico Sugere

A versão dessa história que circula nos fóruns de desenvolvedores é que a Cloudflare vai bloquear agentes de IA em um quinto da web em 15 de setembro.

O changelog diz algo muito mais restrito. Os novos padrões se aplicam a "novos domínios integrados à Cloudflare." Nesses domínios, "bots classificados como Training ou Agent são bloqueados em páginas que exibem anúncios, enquanto Search permanece permitido." Todos os que já estão na Cloudflare escolhem suas próprias configurações e podem fazer isso a qualquer momento antes da data.

Portanto: apenas novos domínios, apenas páginas com anúncios e uma das três categorias ainda passa por padrão. Essa é uma mudança real, mas não é um bloqueio em toda a internet.

Mas o escopo restrito é a parte interessante. A Cloudflare não publicou uma política, ela publicou um padrão, e padrões são a forma como uma política se torna a norma sem que ninguém vote nela. O número que vale a pena observar não é 15 de setembro. É quantos desses domínios nunca alteram a configuração depois disso.

O que isso significa: se você coleta dados, a pergunta útil deixou de ser "consigo passar pela proteção deste site" e passou a ser "em qual categoria este site acha que eu estou". Essas perguntas têm respostas diferentes e apenas uma delas é algo que você pode testar.

A Finalidade Não Pode Ser Medida. Ela Precisa Ser Declarada.

Aqui está o problema prático de classificar o tráfego por intenção: a intenção não está no pacote.

Uma impressão digital pode ser medida. O movimento do mouse pode ser medido. "Por que você está buscando esta página" não pode, então o sistema precisa que o cliente diga isso explicitamente, e precisa de um motivo para acreditar na resposta. Esse é o papel do Web Bot Auth. O agente assina suas requests com uma chave privada, publica um diretório de chaves, e a edge verifica a assinatura contra ele, construído sobre o RFC 9421 HTTP Message Signatures. A documentação da Cloudflare define o critério para um bot verificado como "autoidentificação honesta."

Agora veja o que está aplicando isso em escala. A especificação é a draft-meunier-webbotauth-httpsig-protocol-02, revisada pela última vez em 18 de agosto de 2026. Status pretendido: Standards Track. Status real: um "Active Internet-Draft (individual)" que "não é endossado pelo IETF" e não tem "nenhum status formal no processo de padrões do IETF." Ela tem dois autores. Um trabalha na Cloudflare, o outro trabalha no Google.

Nós achamos que o design está correto, e vale a pena dizer isso antes que as críticas cheguem. Identidade assinada supera a corrida armamentista de CAPTCHAs para qualquer um que pretenda agir corretamente. Um crawler que se identifica pode ser liberado, limitado por rate limit ou cobrado de forma deliberada em vez de depender de suposições, e os proprietários de sites ganham um controle que não atinge visitantes reais como dano colateral. Compare isso a uma década bloqueando faixas de IP e torcendo pelo melhor.

O que ele não pode fazer é impedir alguém. Um sistema construído com base em propósito declarado apenas organiza o tráfego que se declara. Todo o restante cai de volta na stack de detecção que já existia, e essa stack continua ficando mais afiada: a pontuação comportamental com escopo de sessão da Cloudflare foi lançada doze dias após as novas categorias.

Portanto, os dois não estão competindo. A identidade organiza os honestos, a detecção lida com todos os outros, e a segunda é onde o seu tráfego vai parar por padrão se você nunca declarar nada.

Não Há Categoria para Coleta de Dados Públicos

Agora a parte que deveria incomodar qualquer um que opera um pipeline de coleta.

Veja o trabalho que publicamos este ano. Um índice de preços de madeira construído a partir de listagens públicas. Detecção de violação de MAP em seis marketplaces, o que significa buscar a mesma página de produto a partir de seis pontos de vista diferentes e comparar o que cada uma diz. Rankings de lojas de aplicativos e sentimento de avaliações. Verificações de veiculação de anúncios executadas a partir do país onde a campanha foi realmente comprada.

Tente classificar isso em Search, Agent ou Training.

Search não se encaixa: a própria definição da Cloudflare inclui a expectativa de "tráfego de referência ou outra compensação equivalente em troca", e uma verificação noturna de preços não envia referências para ninguém. Agent também não se encaixa, porque nenhum humano está sentado em frente a uma tela esperando por essa requisição. E Training está claramente errado, já que nada é absorvido por um modelo.

Esta é uma taxonomia criada para descrever o tráfego de IA que surgiu nos últimos três anos, agora aplicada a um setor que a antecede em uma década. Inteligência de preços, dados alternativos, monitoramento de SERP, proteção de marca, verificação de anúncios, monitoramento de compliance: nada disso é novo, nada disso é agêntico e nada disso tem uma categoria própria para marcar.

O tráfego sem categoria definida acaba sendo classificado por quem criou as regras. Geralmente, na opção mais próxima.

O que isso significa para equipes de dados

Quatro medidas que valem a pena tomar enquanto as regras ainda são flexíveis.

Decida qual categoria você assumiria honestamente. Não aquela que apenas abre portas para você. Mas aquela que você defenderia por escrito se um publisher perguntasse diretamente. Se a resposta honesta for "nenhuma dessas", você está no grupo com mais a perder quando a taxonomia se consolidar, e com mais a ganhar ao se manifestar enquanto ainda há espaço para debate.

Analise as configurações do alvo, não as manchetes. A política de bots de um site agora é uma propriedade específica dele, configurável por caminho, e muda sem aviso prévio. Tratar "a Cloudflare bloqueia agents em setembro" como uma certeza sobre o seu pipeline fará você reconstruir partes da infraestrutura que nunca estiveram em risco.

Presuma que o teste de páginas de anúncios vai se espalhar. A Cloudflare vinculou seu padrão a páginas que exibem anúncios, um bom indicador de "esta página ganha dinheiro com a atenção humana". Esse limite vai mudar, e a Cloudflare não é a única a defini-lo. O AWS WAF lançou a monetização de tráfego de IA em 15 de junho de 2026, respondendo com um 402 e termos de pagamento legíveis por máquina. A Akamai seguiu o caminho das parcerias com TollBit e Skyfire. Três dos maiores provedores de edge agora vendem a mesma superfície de controle, que analisamos pelo lado da precificação quando o pay-per-crawl foi lançado.

Mantenha sua coleta capaz de operar em qualquer uma das vias. A via identificada (assinar, declarar, ser liberado ou ser faturado) e a não identificada (ser avaliado pelo comportamento, como sempre) vão coexistir por anos. Projetar sua arquitetura como se apenas uma delas existisse é o erro mais custoso aqui, em ambas as direções.

As categorias serão redesenhadas

Uma previsão que sustentamos com segurança: uma quarta categoria surgirá dentro de um ano.

A primeira versão de qualquer taxonomia é escrita por quem está sob pressão, e as partes classificadas não estão presentes quando isso acontece. Busca, Agente e Treinamento descrevem o que as empresas de IA fazem com os publicadores de conteúdo. Essas categorias não descrevem uma empresa de pesquisa de mercado, uma equipe de compliance ou um varejista verificando o preço de um concorrente na prateleira, e esses três já coletavam páginas públicas de forma educada antes mesmo de "agente" significar algo neste contexto.

A disputa sobre como essa quarta opção será chamada, e quem poderá selecioná-la, terá mais impacto para o setor de dados do que qualquer benchmark anti-bot publicado este ano. Vale a pena participar dessa discussão.

Porque a alternativa é bastante simples. Se o seu tráfego não puder se identificar, outra pessoa definirá essa identidade por você.