...

Los tribunales rechazan la demanda contra el asistente de código: qué implica

Los tribunales rechazan la demanda contra el asistente de código: qué implica

El Noveno Circuito de EE. UU. desestimó la demanda colectiva contra GitHub Copilot, dejando sin resolver la cuestión de si entrenar IA con código con licencia infringe la DMCA.

Una decisión unánime del Noveno Circuito de Estados Unidos ha descartado la demanda colectiva presentada por programadores contra GitHub Copilot y OpenAI Codex, argumentando que generar código nuevo no equivale a copiar código protegido por derechos de autor. La sentencia, firmada por el juez Eric Miller, se centra en la interpretación de la sección 1202(b) de la DMCA y, aunque resuelve el caso de los «outputs», deja en el aire la polémica sobre el uso de datos de entrenamiento.

El razonamiento jurídico: ¿qué prohíbe realmente la DMCA?

La clave del litigio radica en la sección 1202(b) de la DMCA, que prohíbe eliminar o alterar la información de gestión de derechos (CMI) – nombre del autor, aviso de copyright y términos de licencia – de una obra ya existente. En el contexto del código abierto, esa información suele aparecer en la cabecera del archivo.

Los demandantes sostenían que Copilot reproducía fragmentos de código sin incluir esas cabeceras, lo que, según ellos, constituía una eliminación de CMI. El tribunal refutó esa tesis con un argumento simple pero contundente: no se puede eliminar algo que no se ha copiado. Copilot, según su propia descripción, no busca en una base de datos de fragmentos pre‑existentes como lo haría un motor de búsqueda; en cambio, predice la continuación estadísticamente más probable a partir de patrones aprendidos durante el entrenamiento.

Como lo expresó Miller, «quien crea una obra nueva y omite incluir CMI no puede decirse que haya ‘eliminado’ ni ‘alterado’ nada». La analogía con los motores de búsqueda, que sí recuperan copias exactas, constituye el corazón del razonamiento del juez.

Lo que el fallo no aborda: el entrenamiento de los modelos

La demanda se basaba en dos teorías distintas. La primera –la que perdió– sostenía que Copilot emitía código memorizado del entrenamiento sin los avisos de copyright correspondientes. La segunda teoría, que quedó sin examinar, afirmaba que los demandantes habían cargado código con licencia en los datos de entrenamiento, eliminando los avisos antes de hacerlo.

El tribunal no se pronunció sobre esta segunda hipótesis porque los propios abogados de los programadores la abandonaron al presentar la primera moción de desestimación. Cuando el juez del distrito preguntó directamente si la queja versaba sobre el uso del código en el entrenamiento, el abogado respondió «quizás no». El tribunal anotó que «la queja no versa sobre el entrenamiento» y, al no corregir esa omisión, los demandantes incurrieron en lo que los juristas llaman «forfeiture»: la falta de una alegación adecuada elimina la posibilidad de que el tribunal la evalúe.

En consecuencia, la decisión no establece que el entrenamiento con código bajo licencia sea lícito; simplemente indica que, bajo la forma en que se presentó la demanda, esa cuestión quedó fuera del alcance del veredicto.

Impacto económico y comparaciones con casos precedentes

El tribunal también explicó por qué la desestimación era económicamente razonable. La DMCA permite sanciones de hasta 25,000 dólares por infracción, mientras que el derecho de autor tradicional prevé hasta 30,000 dólares por obra. La diferencia es significativa, pero el número de supuestas infracciones habría sido astronómico si se considerara cada línea de código generada como una copia directa.

Para poner el número en perspectiva, si cada uno de los 2.5 millones de usuarios activos de Copilot generara 10 fragmentos de código al día, en un año se contarían más de 9 mil millones de «posibles» infracciones. Aplicar la multa máxima por cada una resultaría en una cifra imposible de pagar, lo que justifica la necesidad de un enfoque más matizado.

Este caso se inscribe dentro de una serie de litigios que intentan adaptar la legislación de derechos de autor a la era de la IA. En 2023, Google enfrentó una demanda similar por su herramienta de búsqueda de imágenes, y en 2024, Getty Images persiguió a Stability AI por entrenar sus modelos con fotografías protegidas. En ambos casos, los tribunales han mostrado una tendencia a diferenciar entre la reproducción directa y la generación basada en patrones.

  • GitHub Copilot se posiciona como una herramienta de asistencia, no como un motor de búsqueda de código.
  • La decisión refuerza la distinción legal entre outputs (salidas) y inputs (entradas) en los modelos generativos.
  • El vacío legal sobre el entrenamiento persiste, lo que sugiere que futuros litigios podrían centrarse exclusivamente en esa cuestión.

Reacciones de la comunidad y los actores involucrados

Tras el fallo, los representantes de los desarrolladores expresaron su decepción, pero también su reconocimiento de que el caso abrió una puerta para debatir el uso de datos con licencia en el entrenamiento de IA. Por su parte, GitHub emitió un comunicado que destacó la claridad del veredicto respecto a los «outputs» y reiteró su compromiso de seguir mejorando los filtros de licencia para evitar cualquier posible conflicto futuro.

Expertos en derecho de tecnología, como la profesora de Stanford Laura DeNardis, señalaron que «la decisión muestra la necesidad de una legislación específica que regule el entrenamiento de IA, algo que la DMCA, diseñada en la era pre‑digital, no contempla plenamente». La comunidad legal espera que el Congreso de EE. UU. abra una discusión legislativa al respecto.

Para más detalles, consulte el artículo original en WWWhat’s New.

💡 El panorama general: ¿Cómo nos afecta esto?

El impacto inmediato es la reafirmación de que los asistentes de código como Copilot pueden seguir operando sin que cada línea generada se considere una copia directa de código protegido. Sin embargo, la falta de una respuesta judicial sobre el uso de datos de entrenamiento mantiene la incertidumbre para empresas que desarrollan modelos de IA a gran escala.

Desde el punto de vista ético, la cuestión sigue abierta: ¿es justo que una herramienta se alimente de código abierto sin reconocer explícitamente a sus autores? La respuesta podría influir en la adopción de licencias más restrictivas o en la creación de nuevos marcos de atribución dentro de los ecosistemas de código abierto.

En el futuro, es probable que veamos más demandas que se centren exclusivamente en el proceso de entrenamiento, lo que podría llevar a una regulación más clara o incluso a la necesidad de crear bases de datos de código con licencias explícitas para entrenamiento de IA. La comunidad de desarrolladores y las empresas tecnológicas deben prepararse para adaptarse a ese escenario, ya que la cuestión de la propiedad intelectual en la era generativa está lejos de estar resuelta.

Créditos y referenciasInformación basada originalmente en la cobertura de WWWhat’s New y contrastada de forma independiente por el equipo de redacción de Data Mindset.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Seraphinite AcceleratorOptimized by Seraphinite Accelerator
Turns on site high speed to be attractive for people and search engines.