¿Qué ocurrió?

Anthropic ha revelado que pronto pondrá marca de agua al contenido procesado —no solo generado— por cualquiera de sus modelos. En un artículo de soporte, la compañía explicó que despliega marcas legibles por máquina para cumplir el Reglamento de IA de la Unión Europea.

La norma obliga a todos los proveedores de sistemas de IA a marcar las salidas de audio, imagen, texto y vídeo generadas o manipuladas con IA. Se aplica a cualquier modelo publicado después del 2 de agosto y concede un plazo hasta diciembre de 2026 para actualizar los modelos publicados con anterioridad.

¿Cuál es el alcance?

Anthropic confirmó que, en adelante, todos los nuevos modelos ofrecidos globalmente —no solo en la UE— marcarán el contenido generado con IA "desde el primer día". Las salidas de texto llevarán "marcas de agua incrustadas", invisibles para el usuario, mientras que otros "archivos generados incluirán metadatos de procedencia firmados digitalmente allí donde sea posible".

Lo llamativo es que la empresa ha trazado un alcance más amplio del exigido. La UE no requiere marca de agua cuando el sistema cumple "una función de asistencia para edición estándar" —el ejemplo de la propia guía es la corrección gramatical— ni cuando no "altera sustancialmente" el texto del usuario ni su significado. Anthropic aplica la marca a todo el contenido procesado allí donde es posible.

Por qué no puede hacerse la distinción

Una marca aplicada en el nivel del modelo no puede distinguir la generación completa de la corrección de una coma. Claude puede acabar así marcando justo el contenido que la ley se escribió para dejar fuera.

Hasta qué punto marca realmente no se sabrá hasta que Anthropic publique una herramienta de detección que pueda probarse. La compañía dijo que planea compartir en algún momento los detalles sobre cómo detectar las marcas, para ofrecer el soporte técnico que exige la ley europea.

Los límites

  • Alcance: todo el contenido procesado, no solo el generado
  • Texto: marcas incrustadas invisibles para el usuario
  • No textual: el enfoque de metadatos C2PA para la procedencia
  • Dónde no funciona: "algunas plataformas o funciones" que no lo admiten
  • Calendario legal: modelos posteriores al 2 de agosto; diciembre de 2026 para los anteriores
  • Herramienta de detección: aún no publicada

¿Por qué es importante?

El enfoque descrito por la UE y aplicado por Anthropic tiene una debilidad: resulta trivialmente fácil de sortear para quien actúa de mala fe, mientras que puede penalizar a los usuarios que confían en el sistema.

Esa asimetría está en el centro del debate. Quien quiera ocultar su rastro puede romper la marca pasando el texto por otra herramienta; quien no intenta ocultar nada se queda con un texto marcado por haber pedido una corrección gramatical.

Por qué el enfoque de 'arrasarlo todo'

Hay una razón técnica para que la empresa haya trazado un alcance mayor del exigido: el modelo puede saber qué petición ha recibido, pero no puede medir cuánto cambió la salida con esa indicación. Reescribir un párrafo y corregir una coma son la misma operación desde el lado del modelo: entra texto y sale texto.

Trazar esa distinción exigiría una capa aparte que midiera cuánto se parece la salida a la entrada; esa capa necesitaría un umbral, y el umbral quedaría inevitablemente abierto a discusión. Anthropic parece haber optado por no abrir ese debate en absoluto.

Qué no está cerrado

Hasta qué punto resiste realmente la marca, y a qué operaciones sobrevive, no puede comprobarse mientras no se publique la herramienta de detección. Tampoco se dio una fecha para que Anthropic la comparta.