Em 19 de fevereiro de 2026, o Stack Overflow e a Cloudflare tornaram público algo que a maior parte do setor de dados da web não previa. Eles lançaram em conjunto o pay-per-crawl: um sistema no qual crawlers de IA recebem uma resposta 402 Payment Required em tempo real e podem pagar o preço do publisher ou sair. A identidade do bot é verificada na edge, o preço é definido pelo site e a transação é tarifada.
A Cloudflare está à frente de cerca de um em cada cinco sites na internet. Portanto, quando ativaram o bloqueio por padrão para bots de IA conhecidos e criaram um marketplace onde publishers cobram por request, o modelo de acesso para uma parcela enorme da web aberta mudou em um fim de semana.
Se você mantém infraestrutura de dados da web agora, este não é apenas um anúncio da Cloudflare para ignorar. Ele muda a lógica sobre o que significa ser "aberto".
O mecanismo por trás da mudança
A mudança técnica é pequena. A Cloudflare ressuscitou o HTTP 402, o status code "Payment Required" há muito inativo, e o conectou a um registro de crawlers de IA verificados. Um publisher define um preço por request. O crawler mantém um saldo de créditos e paga, ou é bloqueado.
A mudança não técnica é maior. Antes disso, as únicas maneiras de impor a regra de "não faça scraping do meu conteúdo para IA" eram o robots.txt (consultivo, não obrigatório) e o bloqueio agressivo de bots (binário, com perdas e cheio de falsos positivos). A Cloudflare adicionou uma terceira opção: uma etiqueta de preço.
A economia dessa terceira opção funciona de forma diferente das duas primeiras. O robots.txt não custa nada e é ignorado. O bloqueio de bots custa tráfego de usuários reais classificados incorretamente como bots. Uma etiqueta de preço, por definição, separa crawlers dispostos a pagar daqueles que não estão.
Quem realmente está cobrando
O Stack Overflow foi o parceiro de lançamento porque seus dados de treinamento têm valor real e eles já estavam negociando acordos bilaterais com a OpenAI e outros. O marketplace da Cloudflare generalizou esses acordos bilaterais em um registro ao qual o restante dos publishers pode se conectar.
A lista de quem aderiu cresceu rápido. A AWS lançou sua própria camada de monetização de bots. A Akamai construiu uma equivalente. A proposta para os publishers é direta: em vez de um processo judicial caro contra um laboratório de IA, tenha uma linha de receita que paga por request.
Por enquanto, isso se aplica principalmente à camada de conteúdo de alto valor: documentação, notícias, Q&A técnico e dados de referência estruturados. A cauda longa da web (pequenos sites de e-commerce, anúncios regionais, fóruns de nicho) não fica atrás de nenhum controle desse tipo e provavelmente nunca ficará. O próprio bot management da Cloudflare tem um custo de operação, e o pay-per-crawl é opcional. Ele só compensa para sites onde vale a pena cobrar por uma única visualização de página.
O que isso significa para pipelines de dados da web
Se você estiver construindo um pipeline que extrai dados do Stack Overflow, de grandes sites de notícias ou de qualquer um dos publishers que estão aderindo ativamente, suas opções se reduzem a três. Pagar pelo marketplace assim que seu tráfego for identificável como um crawler de IA. Migrar para um dataset licenciado onde houver um. Ou encontrar os dados onde eles ainda estiverem abertos.
A maioria das equipes acabará fazendo as três coisas em momentos diferentes. Essa é a realidade prática. A web está se dividindo entre licenciada e aberta, e essa fronteira não é traçada de forma limpa ao longo das linhas de domínio. O mesmo publisher pode ter uma seção protegida por 402 e outra seção aberta. O mesmo site pode cobrar de um crawler e ignorar completamente um bot de pesquisa.
Acreditamos que a reação prática para equipes de engenharia é a seguinte. Primeiro, faça uma auditoria nas suas fontes. Se uma parte relevante do seu pipeline extrai dados do Stack Overflow, Reddit, grandes sites de notícias ou qualquer um dos vários publishers que buscam abertamente esses acordos, presuma que o modelo de acesso mudará dentro de doze meses. Segundo, separe fontes licenciadas de fontes abertas na sua arquitetura desde cedo. Um pipeline que trata todas as fontes de forma idêntica fica frágil quando metade delas começa a cobrar e a outra metade não. Terceiro, pare de tratar o robots.txt como o único sinal. A resposta 402 terá significado operacional mesmo que seu crawler não seja um agente de IA. Falsos positivos são inevitáveis em um sistema tão novo.
Isso se soma à pressão de conformidade de dados de treinamento da Lei de IA da UE, que já empurrava as equipes para fontes com rastreamento de procedência. O pagamento por crawl é a mesma pressão, mas com uma camada de faturamento integrada.
A visão realista
Alguns pontos vão causar problemas. A verificação de identidade da Cloudflare depende do registro dos bots. Bots que não se registram, ou que parecem tráfego residencial, simplesmente não acionam o 402. Em vez disso, eles enfrentam a detecção normal de bots. Esse já é o caminho que a maioria dos crawlers de IA agressivos vai seguir. Portanto, o pagamento por crawl funciona para os bots que querem cumprir as regras. Aqueles que não querem nunca iriam respeitar o robots.txt de qualquer forma.
A maior mudança talvez não seja o marketplace em si. É o fato de que a pergunta "este conteúdo está disponível para treinamento de IA?" passou a ter uma resposta contratual em vez de uma suposição baseada no robots.txt. Publishers finalmente podem impor restrições. Crawlers finalmente têm certeza. A zona cinzenta diminui onde o marketplace alcança.
O que continua cinzento é tudo o que fica de fora. O site pequeno sem Cloudflare, o agregador regional sem estratégia de IA, a cauda longa da web pela qual ninguém está negociando: esses não recebem um 402 e também não fecham um acordo de licenciamento. Eles mantêm a política de acesso que já tinham, apenas protestando mais alto agora que existe um precedente de compensação.
Para onde isso vai
Duas previsões, e elas não são conservadoras.
Primeiro: os próximos doze meses verão um segundo nível de paywall, desta vez para bots que não são de IA. O mecanismo de marketplace é apenas um código de status HTTP e uma camada de faturamento. Não é tecnicamente difícil estender isso para cobrança de rastreadores de busca, bots de arquivamento ou monitoramento de concorrentes. Se os publishers vão manter a restrição de cobrar apenas rastreadores de IA, depende de como a próxima onda vai se comportar. Na maioria dos anos, essa barreira cai.
Segundo: laboratórios de IA vão contornar isso. Não ignorando o 402 (isso é rastreável e passível de processo judicial), mas comprando conjuntos de dados licenciados em massa e depois roteando todo o restante por meio de tráfego que parece de usuários reais. A Cloudflare já está lançando mais detecção comportamental precisamente porque sabe disso. Acompanhamos essa corrida armamentista migrar para sinais de nível de sessão há dois anos. Isso não termina com um marketplace.
A pergunta interessante para quem constrói software não é se deve pagar. É em que lugares a web aberta continua aberta, e por quanto tempo.