← Todos los artículos

Demanda de Google contra SerpApi: la verificación de bots no es la cuestión

Dos tribunales, una verificación de bots de Google, fallos opuestos con once días de diferencia. La demanda de Google contra SerpApi muestra qué lo decide ahora: qué contenido está detrás de la verificación.

Una verificación de bots, dos tribunales, respuestas opuestas

Con once días de diferencia este verano, dos jueces federales analizaron la misma verificación de bots de Google, al mismo demandado y el mismo tipo de reclamo. Llegaron a conclusiones opuestas.

El 20 de julio de 2026, la jueza principal Yvonne Gonzalez Rogers del Distrito Norte de California desestimó las demandas por DMCA de Google contra SerpApi, la empresa que vende resultados de Google a través de una API. El 31 de julio, el juez Paul Engelmayer del Distrito Sur de Nueva York rechazó en su mayoría las mociones de SerpApi y Perplexity para desestimar la demanda de Reddit, la cual se basa en el mismo sistema de Google.

Caso Tribunal Fallo Reclamos de DMCA
Google v. SerpApi N.D. California 20 de julio de 2026 Desestimado
Reddit v. SerpApi S.D. New York 31 de julio de 2026 Sobreviven en su mayoría

La demanda de Google contra SerpApi acaparó los titulares, y gran parte de la cobertura calificó a julio con una victoria y una derrota para los scrapers. Nosotros lo interpretamos de otra manera. Superar la verificación no fue lo que diferenció ambos resultados. Lo que estaba detrás de la verificación, y quién posee los derechos sobre ello, sí lo fue. Para cualquiera que recopile datos web, esa es una regla mucho más útil que cualquier titular.

Cómo se ve SearchGuard desde el lado del receptor

SearchGuard es el challenge de JavaScript que Google colocó frente a Search en enero de 2025. Según la propia explicación de Google, una consulta procedente de una fuente que no reconoce recibe código para ejecutar. El navegador de una persona responde sin que nadie lo note; la mayoría de los clientes automatizados no pueden hacerlo y son rechazados.

Nosotros mismos nos encontramos con esto. En pruebas que ejecutamos el 17 de septiembre de 2026, Google Search respondió a algunas solicitudes automatizadas con una página de 92 KB titulada simplemente "Google Search": HTTP 200, sin resultados y con un aviso para activar JavaScript. La propia barrera de Reddit se ve prácticamente igual a nivel de red (un 200 titulado "Reddit - Prove your humanity"). Cualquier herramienta que juzgue el éxito por el código de estado registrará ambas como páginas entregadas.

Aquí está la parte que se perdió en los titulares. La jueza Gonzalez Rogers no determinó que SerpApi nunca hubiera eludido SearchGuard. Sostuvo que Google había formulado adecuadamente un reclamo bajo la Sección 1201 de la DMCA y rechazó el argumento de SerpApi de que Google, al no ser propietario, no podía demandar en absoluto. Google perdió de todos modos.

Qué significa esto: los tribunales no están tratando la pregunta "¿superaste la verificación?" como la cuestión decisiva. La están tratando como el punto de partida de una.

Por qué Google perdió y Reddit no

La Sección 1201 de la DMCA prohíbe eludir una medida que controle el acceso a "una obra protegida bajo este título", lo que se refiere a una obra con derechos de autor. La propia demanda de Google describió sus resultados como recopilaciones de información pública, con Knowledge Panels que "pueden contener algún contenido protegido por derechos de autor". La orden judicial tomó la palabra de Google: "En la medida en que los resultados de Google Search no contengan contenido protegido por derechos de autor, no se puede afirmar que SearchGuard controle de manera efectiva el acceso a una obra protegida bajo la Copyright Act". Esa mitad del caso fue desestimada sin derecho a enmienda.

La parte correspondiente a los Knowledge Panels no superó una segunda prueba. La medida debe operar "con la autorización del titular de los derechos de autor", y Google no había presentado ni una sola cláusula de las licencias detrás de esas imágenes. Google gestiona el acceso. No es propietario de la mayor parte de lo que hay detrás.

Reddit se encuentra en una posición distinta. Las publicaciones de sus usuarios están protegidas por derechos de autor, y su acuerdo de usuario le otorga a Reddit una licencia sobre todas ellas. Engelmayer respaldó las demandas bajo la sección 1201(a)(1)(A) contra ambos demandados y bajo la sección 1201(a)(2) contra SerpApi, mientras que desestimó el reclamo bajo la 1201(b) y los cargos de enriquecimiento injusto y competencia desleal bajo la ley estatal. La misma verificación, pero este demandante sí tenía derechos sobre el contenido que protegía. El tribunal dejó abierta la duda de si los fragmentos cortos que aparecen en las páginas de Google están protegidos en absoluto, y Oxylabs, también demandada en el caso, todavía tiene pendiente su propia moción de desestimación.

La licencia se está convirtiendo en el cerrojo

Google captó el mensaje. Su demanda enmendada, presentada el 10 de agosto, reconstruye el caso en torno a contratos. Afirma que los licenciantes autorizaron los controles de acceso "y en algunos casos insistieron en que Google lo hiciera". Sostiene que un socio anónimo ha obligado a Google desde 2017 a "emplear esfuerzos comercialmente razonables para proteger el contenido licenciado contra accesos no autorizados de terceros", y que el acuerdo con Reddit "ordena a Google no permitir que terceros extraigan y comercialicen de forma independiente el contenido licenciado". Incluso presenta la propia Política de Privacidad de Google como autorización de los usuarios.

La segunda moción de desestimación de SerpApi responde que ninguno de esos acuerdos se encuentra realmente ante el tribunal, y que "una cláusula contra descargas no es una cláusula contra el acceso". El 15 de septiembre, el juez denegó la solicitud de SerpApi para obligar a Google a presentar las licencias. La audiencia sobre la moción está programada para el 13 de octubre de 2026, según el expediente judicial.

Creemos que el fallo de octubre importa menos que el manual de estrategia que ya ha establecido. Una cláusula que exige al licenciatario proteger el contenido contra accesos no autorizados solía ser texto estándar. Tras este verano, es el elemento clave para reclamar daños y perjuicios legales de $200 a $2,500 por infracción. Por lo tanto, espera que cualquier acuerdo de contenido firmado a partir de ahora incluya una, incluidos los esquemas de acceso de pago que comenzaron a surgir en torno a pay-per-crawl.

Las cuentas nunca fueron la duda abierta

Un aspecto de esto no cambió en absoluto. A mediados de septiembre, un juez federal de California formalizó una sentencia acordada entre LinkedIn y ProAPIs, junto con su socio Netswift: detener el scraping, detener la venta o transferencia de los datos, dejar de usar cuentas falsas y eliminar lo extraído. La demanda de LinkedIn describía millones de cuentas falsas, con cientos o miles creadas cada día.

Estas acusaciones se centraron en las cuentas, no en eludir una verificación. Y el resultado fue total: sin acceso, sin reventa y sin datos.

Qué significa esto para los equipos de datos

Somos ingenieros, no abogados, y ambos fallos de julio ocurrieron en la fase de petición de desestimación (motion to dismiss) y no en juicio. Lee lo que sigue como un mapa hacia dónde se dirigen los argumentos y consulta las dudas reales con asesores legales.

  1. Clasifica tus objetivos según lo que conservas. Los precios, los niveles de stock, los rankings, los enlaces y los listados son hechos. Las publicaciones, las reseñas, los artículos, las fotos y las letras de canciones son expresión. La parte permanente de la orden del 20 de julio cubre el primer tipo; el caso de Reddit pertenece al segundo.
  2. La ruta no limpia el contenido. Las reclamaciones vigentes de Reddit conciernen a publicaciones presuntamente extraídas de las páginas de resultados de Google, no de reddit.com. Extraer contenido de usuarios mediante un intermediario de búsqueda arrastra el reclamo del propietario.
  3. La propia verificación del propietario es el caso sólido. La debilidad de Google residía en controlar el acceso al trabajo de terceros. Un editor que posee sus artículos y adquirió un producto antibot para protegerlos no comparte esa debilidad, y según el informe State of Web Access 2026 de Zyte, el 18.5% de los sitios principales utiliza un servicio dedicado de detección de bots, cada uno por elección propia.
  4. Cuenta los inicios de sesión. Si algún paso de tu pipeline inicia sesión, ahí es donde se concentra tu exposición, sin importar lo que los tribunales terminen dictaminando sobre las comprobaciones de bots.
  5. Presupuesta la fricción que ningún tribunal eliminará. Google confirmó el 26 de agosto que los enlaces de resultados ahora pasan por una redirección google.com/goto. Derek Perkins de Nozzle reportó que los enlaces no se pueden decodificar localmente y que resolver un ranking de cinco páginas requiere de 500 a 1,000 requests. Si sumas la eliminación de num=100 de septiembre de 2025 (el impacto que esto tuvo en el seguimiento de rankings), los datos de búsqueda se encarecieron dos veces, sin intervención de ningún juez.

Del código a los contratos

Durante años, el debate sobre el web scraping giró en torno a si una verificación de bots cuenta como un cerrojo. La respuesta de este verano es más tajante que un simple sí o no: puede serlo, cuando el cerrojo pertenece a quien posee lo que está dentro, o a alguien a quien hayan autorizado por escrito.

Eso traslada la disputa fuera de la ingeniería y la lleva a los departamentos de licencias. Si sumas la iniciativa de Cloudflare para clasificar el tráfico de bots según su propósito declarado, la dirección parece clara: el acceso se decide por quién eres y qué has firmado, y cada vez menos por cómo se ven tus requests.

Si recopilas datos públicos, julio aclaró tu posición. Si recopilas las palabras de otras personas a través de la puerta de un tercero, defender tu postura acaba de volverse mucho más difícil.