Copyright

    Web scraping para entrenar IA: ¿es legal en la UE?

    Redacción Lexdara · Publicado: · Última actualización:

    Revisado por Aldara Fernández Hernández

    Tres dilemas: copyright infringement, RGPD compliance, AI Act requisitos. Litigios Getty v OpenAI, NYT v OpenAI: scraping masivo es barato pero legalmente riesgoso.

    Portada del artículo: Web Scraping Para Entrenar IA: ¿Es Legal En La UE?

    Web scraping + IA: ¿cuándo es ilegal entrenar un algoritmo con datos ajenos?

    El dilema fundamental

    Eres una startup que quiere entrenar una IA.

    Necesitas millones de ejemplos para que funcione bien.

    ¿De dónde sacas esos datos?

    Opción 1: scrapar la web

    Escribes un bot que baja información de sitios públicos: artículos, comentarios, código, imágenes.

    Costo: $100 en infraestructura.

    Resultado: IA entrenada en 48 horas.

    ---

    Opción 2: pedir consentimiento

    Contactas a cada propietario de contenido.

    Le pides permiso para usar sus datos.

    Esperas respuesta.

    Costo: Infinite (nadie responde, o exigen compensación).

    Resultado: 2 años después, tienes 100 ejemplos.

    IA no funciona.

    ---

    Opción 3: pagar licencias

    Compras acceso a datasets bajo licencia.

    Costo: $50.000-500.000 según tamaño.

    Resultado: Legal, pero costoso. Solo startups financiadas pueden hacerlo.

    ---

    Pregunta legal:

    En 2026, ¿cuál de estas tres opciones es legal?

    Respuesta complicada: Depende.

    Pero la tendencia regulatoria es clara: la Opción 1 está siendo restringida agresivamente.

    ---

    Por qué web scraping + IA es un conflicto jurídico

    El viejo internet (2010-2020)

    Web scraping existía pero era técnicamente complicado y legalmente ambiguo.

    Algunos sitios lo permitían. Otros lo prohibían. Nadie really sabía qué hacer.

    El nuevo internet (2023-2026)

    Tres cosas cambiaron:

    1. IA generativa llegó y necesita DATOS MASIVOS
    • Entrenar GPT-4, Claude, Gemini requiere 100B+ tokens
    • No hay suficiente data pública consensuada
    • Resultado: scraping masivo de contenido sin permiso
    1. Litigios masivos llegaron
    • Demandas contra OpenAI, Meta y otros proveedores de IA
    • Titulares de derechos (agencias de noticias, propietarios de contenido) demandando
    • Resultado: precisión legal en tribunales
    1. Regulación llegó (AI Act + RGPD actualizadas)
    • AI Act Art. 10 exige "alta calidad de datos"
    • RGPD Art. 6 requiere base legal para procesar
    • RGPD Art. 9 prohíbe datos especiales sin consentimiento

    Resultado: Web scraping es ahora más legal ambiguo que nunca.

    ---

    El marco legal en octubre de 2026

    Capa 1: derecho de autor (copyright)

    La pregunta: ¿Es copyright infringement usar contenido para entrenar IA?

    Respuesta tradicional: SÍ, si usas el contenido de forma que compite con el original.

    La complicación: ¿Entrenar un modelo es "usar" de forma que compite?

    ---

    #### Litigios sobre entrenamiento de IA

    ¿Qué está ocurriendo?

    Titulares de derechos (Getty Images, New York Times, autores de libros) han demandado a empresas de IA por usar su contenido para entrenar sin licencia.

    Argumentos de demandantes:

    • ✅ El contenido tiene copyright
    • ✅ Nunca hubo licencia ni consentimiento
    • ✅ IA genera contenido que compite con original
    • ✅ Resultado: infringement

    Argumentos de defensores:

    • "Es fair use (transformativo)"
    • "No reproducimos exactamente, solo extraemos características"
    • "Es necesario para innovación"

    Estatus legal (octubre 2026):

    Los litigios siguen en curso. Las tendencias judiciales sugieren que los titulares de derechos tienen argumentos sólidos basados en leyes de copyright ya existentes.

    Implicación: Web scraping de contenido protegido = riesgo legal alto.

    ---

    Capa 2: protección de datos (RGPD)

    La pregunta: ¿Es legal scrapar datos personales de la web?

    Respuesta clara: NO, sin base legal.

    ---

    #### Ejemplo: scraping datos de redes sociales

    Qué pasa:

    Bot baja perfil de 1 millón de usuarios de LinkedIn (nombre, ubicación, historial laboral, conectiones).

    Objetivo: Entrenar IA de "predicción de carrera".

    ¿Es legal?

    ❌ NO. Múltiples violaciones:

    1. RGPD Art. 6 — No hay base legal para procesar
    • No es consentimiento (no pidieron)
    • No es contrato (no hay contrato)
    • No es obligación legal
    • No es interés público
    • No es interés legítimo (LinkedIn se opone explícitamente)
    1. RGPD Art. 9 — Datos especiales sin consentimiento
    • Historial laboral es dato especial en algunos contextos
    1. Violación de TOS — LinkedIn prohíbe scraping

    ¿Cuál es la sanción?

    • AEPD (España): Multa de hasta €20M o 4% facturación (datos personales)
    • Responsabilidad civil: LinkedIn puede demandar
    • Orden de borrado: Eliminar todos los datos

    ---

    #### Caso real: Cambridge Analytica (2016-2018, pero lecciones vívidas en 2026)

    Cambridge Analytica scrapó 87 millones de perfiles de Facebook sin consentimiento.

    Los usó para entrenar sistemas de predictive targeting político.

    Resultado:

    • Facebook multado: €5M GDPR (antes regulación más estricta)
    • Cambridge Analytica: Cierre de empresa
    • Precedente legal: Scrapar datos personales = violación grave

    Implicación para 2026: El RGPD es MUCHO más estricto ahora.

    ---

    Capa 3: AI Act + requisitos de calidad de datos

    El AI Act Art. 10 exige:

    "Sistemas de IA de alto riesgo deben usar datos de alta calidad, documentados, verificados... sin sesgos injustificados."

    ¿Qué significa?

    Si entrenas una IA con datos scrapados de web sin control:

    ❌ No tienes documentación de origen ❌ No tienes verificación de calidad ❌ No tienes control de sesgos

    Resultado: Sistema probablemente no cumple AI Act.

    ---

    Lo que el AI Act dice explícitamente

    Art. 10: requerimientos de calidad de datos

    "Los datos utilizados en el entrenamiento de sistemas de IA de alto riesgo deberán ser sometidos a examen de calidad y un proceso de documentación..."

    Lo que esto exige:

    1. Documentación del origen de datos
    • ¿De dónde vienen los datos?
    • ¿Tienen licencia?
    • ¿Hay consentimiento?
    1. Verificación de calidad
    • ¿Los datos están limpios?
    • ¿Están representativos?
    • ¿Hay sesgos?
    1. Trazabilidad
    • Debes poder probar cada dato
    • Debes poder auditar procesos

    ¿Qué pasa si usas web scraping sin documentación?

    No puedes probar cumplimiento. Resultado: Incumplimiento Art. 10.

    Multa: €20M o 4% facturación.

    ---

    Casos de uso: ¿legal o ilegal?

    Caso 1: startup scrape artículos de noticias para IA de resumen

    ¿Qué hace?

    Bot baja 100.000 artículos de El País, BBC, Reuters.

    Los usa para entrenar modelo que genera resúmenes automáticos.

    ¿Es legal?

    ❌ PROBABLEMENTE NO.

    Por qué:

    1. Copyright — Artículos están protegidos
    2. Derecho de reproducción — Scraping implica copia de obra completa
    3. Fair use débil — No es educativo (es comercial)

    Potencial responsabilidad:

    • Demanda de cada medio de comunicación
    • Múltiples litigios simultáneos

    Costo más probable: €5M+ en acuerdos + multa AEPD

    ---

    Caso 2: académico scrape papers de ArXiv para IA

    ¿Qué hace?

    Investigador baja 50.000 papers de arXiv.org.

    Los usa para entrenar modelo de análisis de tendencias de investigación.

    ¿Es legal?

    ✅ PROBABLEMENTE SÍ.

    Por qué:

    1. ArXiv lo permite explícitamente
    • ArXiv fue diseñado para acceso abierto
    • TOS permite reutilización académica
    • Contenido bajo licencias Creative Commons
    1. Fair use fuerte
    • Propósito académico/educativo
    • Transformativo (análisis de tendencias)
    • No compite con ArXiv
    1. RGPD cumplimiento
    • No contiene datos personales (papers científicos)
    • Base legal: interés público en investigación

    Costo: Probablemente legal. Pero documenta el proceso.

    ---

    Caso 3: IA de análisis de sentimientos de redes sociales

    ¿Qué hace?

    Bot scrape tweets públicos de Twitter/X para entrenar modelo que predice sentimientos sobre temas políticos.

    ¿Es legal?

    ⚠️ GRIS.

    Complicaciones:

    1. Twitter TOS lo prohíbe
    • X prohíbe scraping explícitamente
    • Violarías contrato con la plataforma
    1. RGPD ambiguo
    • Tweets públicos ≠ consentimiento para IA
    • Usuarios podrían considerarlo violación de privacidad
    • Aunque técnicamente no hay datos personales suficientes
    1. Copyright
    • Tweets están protegidos
    • Aunque reutilización con atribución puede ser fair use

    Riesgo legal:

    • X demanda por violación TOS
    • Posible acción AEPD si hay datos personales
    • No hay precedente claro, pero tendencia es restrictiva

    Recomendación: Obtener acceso oficial a API de X con licencia.

    ---

    Caso 4: bot scrape código de GitHub para IA generadora de código

    ¿Qué hace?

    Startup scrape 10 millones de repositorios públicos de GitHub.

    Los usa para entrenar modelo generador de código (GitHub Copilot style).

    ¿Es legal?

    ❌ PROBABLEMENTE NO — Litigios en curso.

    Por qué:

    1. Copyright fuerte
    • Código está protegido como obra literaria
    • Muchos repos tienen licencias restrictivas (GPL, MIT, Apache)
    • Scraping viola esas licencias
    1. Litigios en curso (2024-2026)
    • Software Freedom Conservancy demanda GitHub Copilot
    • Sosteniendo: Scraping código con GPL viola GPL
    • Copilot genera código sin atribuir fuente
    1. AI Act Art. 10
    • Datos no verificados por licencia
    • No hay documentación de derechos

    Potencial resultado:

    • Demanda por copyright infringement
    • Demanda por violación de licencias abiertas
    • Prohibición de servicio
    • Multa AEPD

    Costo: Alto (potencial €50M+).

    ---

    Text and data mining (TDM): la excepción que no existe completamente

    ¿Qué es TDM?

    Text and Data Mining es el proceso de extraer patrones de grandes volúmenes de contenido.

    Parecería que debería estar permitido bajo "investigación".

    Pero:

    ---

    #### Directiva copyright 2019/790: TDM

    La Directiva permite TDM para:

    1. Investigación científica
    • Universidades, centros públicos
    • Propósito: investigación (no comercial)
    1. Organizaciones de investigación
    • Institutos científicos certificados
    • Con límites

    Pero NO protege TDM para:

    ❌ Empresas comerciales (startups, tech companies) ❌ Propósitos comerciales ❌ Entrenar modelos de IA para vender

    ---

    #### Implicación práctica

    OpenAI, Google, Meta, etc., NO pueden escudarse en "research TDM exception".

    Porque:

    • No son universidades
    • El propósito es comercial (vender acceso)
    • No cumplen con requisitos de publicación científica

    ---

    La solución legal en 2026: obtener consentimiento

    Opción 1: licencias agregadas

    Algunas compañías ahora venden acceso a datasets bajo licencia:

    • CommonCrawl — Snapshot de web pública con licencia
    • Wikipedia Datasets — Bajo CC-BY-SA
    • Academic Dataset Providers — Investigación
    • Licensed Content Providers — Acuerdos comerciales

    Costo: $10K-$1M según tamaño.

    Ventaja: Legal. Documentado. Auditable.

    ---

    Opción 2: solicitar consentimiento explícito

    Contactar creadores de contenido:

    "Queremos usar [tu contenido] para entrenar [modelo]. ¿Consientes?"

    Realidad: 99% no responden, 0.5% dice "sí con compensación", 0.5% dice "no".

    Costo: Enorme en tiempo. Muy poco resultado.

    Ventaja: Si alguien acepta, es defensa contra litigio.

    ---

    Opción 3: usar contenido Abierto/CC

    Usar contenido explícitamente bajo licencias abiertas:

    • Creative Commons (múltiples tipos)
    • Open Government Licenses
    • Academic Creative Commons

    Verificar licencia:

    • CC-BY = Puedes usar si atribuyes
    • CC-BY-SA = Puedes usar si atribuyes y compartes bajo misma licencia
    • CC-BY-NC = Puedes usar para no-comercial
    • Otros = Pueden prohibir IA

    Ventaja: Legal por definición de licencia.

    Desventaja: Menos datos que scraping completo.

    ---

    Opción 4: negociar acuerdos directos

    Contactar creadores de contenido de forma profesional:

    "Ofrecemos €50K anuales por derecho de usar tu contenido para entrenar IA."

    Realidad: Algunos creadores de contenido premium (periódicos, publishers) aceptarán.

    Costo: Significativo pero justificable.

    Ventaja: Defensa legal clara. Acuerdo documentado.

    Desventaja: Solo acceso a contenido premium.

    ---

    Checklist: ¿puedo usar estos datos para entrenar IA?

    Antes de usar cualquier dataset:

    Pregunta 1: ¿De dónde vienen los datos?

    • [ ] Web scraping (descargué yo) → RIESGO
    • [ ] Dataset con licencia (compré/conseguí) → SEGURO
    • [ ] Contenido abierto verificado (CC, etc.) → SEGURO
    • [ ] Datos de usuarios (con consentimiento) → SEGURO
    • [ ] Datos propios (mi contenido) → SEGURO

    Pregunta 2: ¿Hay restricciones de licencia?

    • [ ] Verificué todas las licencias → Bien
    • [ ] Algunos elementos tienen GPL/restrictivos → RIESGO
    • [ ] No sé de dónde vienen → RIESGO

    Pregunta 3: ¿Hay datos personales?

    • [ ] SÍ → ¿Tienes base legal (consentimiento)? Si NO = violación RGPD
    • [ ] NO → Continúa

    Pregunta 4: ¿Esto competiría con el original?

    • [ ] SÍ (IA genera contenido que sustituye original) → COPYRIGHT RISK
    • [ ] NO (IA analiza/resume/transforma) → Mejor posición

    Pregunta 5: ¿Tengo documentación de origen?

    • [ ] SÍ, completa → Good
    • [ ] NO → Incumplimiento AI Act Art. 10

    Pregunta 6: ¿Auditaría sesgos en los datos?

    • [ ] SÍ → Cumplimiento AI Act
    • [ ] NO → Violación potencial

    Si tienes RIESGO en cualquier pregunta: Consulta a abogado. No continúes.

    ---

    Recomendación práctica

    Si eres startup/empresa entrenando IA en 2026:

    1. NO scrapar web sin permiso
    • Costo legal > costo de dataset legal
    1. USAR datasets con licencia
    • CommonCrawl: $0 (abierto)
    • Hugging Face Datasets: Gratis-Pago según licencia
    • Academic Torrents: Gratis para investigación
    1. DOCUMENTAR ORIGEN
    • Qué datos, de dónde, bajo qué licencia
    • Auditable para AESIA
    1. AUDITAR SESGOS
    • Requerimiento AI Act
    • Puede evitar problemas posteriores
    1. TENER ABOGADO
    • Especialista en IP/Data
    • Revisar setup antes de lanzar
    • €5K preventivo < €5M en litigios

    ---

    Status legal: octubre 2026

    Hecho confirmado:

    ✅ Web scraping para entrenar IA sin consentimiento = riesgo alto

    ✅ Litigios masivos están ocurriendo

    ✅ AI Act exige documentación de datos (Art. 10)

    ✅ RGPD protege datos personales scrapados

    Tendencia clara:

    → Regulación va más restrictiva

    → Sanciones van más altas

    → Precedentes se establecen

    Recomendación:

    Si dudas de la legalidad, no uses esos datos.

    El costo de la duda es prohibitivo.

    ---

    Recursos

    Legislación:

    • AI Act 2024/1689, Art. 10 (calidad de datos)
    • RGPD Art. 6 (base legal), Art. 9 (datos especiales)
    • Directiva Copyright 2019/790 (TDM)

    Litigios en curso:

    • Demandas contra proveedores de IA (2023-2026)
    • Software Freedom Conservancy v GitHub Copilot (2024-2026)

    Datasets Legales:

    • CommonCrawl (Web pública, abierto)
    • Hugging Face Datasets (Múltiples licencias)
    • ArXiv (Papers académicos)
    • Wikipedia Dumps (CC-BY-SA)

    Instituciones:

    • AEPD (España) — aepd.es
    • EDPB (Europa) — edpb.europa.eu
    • EPO (Patents) — epo.org

    ---

    Web scraping para entrenar IA está en transición.

    De "ambiguo" a "restringido".

    Octubre 2026: Los abogados tienen razón.

    Fuentes

    Fuentes pendientes de añadir.

    Artículos relacionados

    Esta semana en Derecho + IA

    La newsletter semanal de Lexdara: qué ha cambiado en Derecho digital e inteligencia artificial, explicado con fuentes.

    Responsable: Aldara Fernández Hernández. Finalidad: envío de la newsletter semanal. Base jurídica: tu consentimiento. Encargado: Brevo. Puedes darte de baja en cualquier momento. Más información en la Política de privacidad.