Estos programadores ya tienen formas de eludir las marcas de agua de los textos de Claude

Paylaş

Bu Yazıyı Paylaş

veya linki kopyala

A las cuatro horas de que Anthropic confirmara que los modelos de Claude incorporarían marcas de agua invisibles detectables por sistemas informáticos en cualquier contenido generado por IA, el desarrollador Guillaume Meyer ya había publicado una forma de eludirlas.

Su código para eliminar las marcas de agua del texto generado por Claude se popularizó en GitHub, acumuló más de 20,000 favoritos en X y atrajo a más de 100 colaboradores, muchos de los cuales incorporan la tecnología a sus propios proyectos. "Anthropic está incorporando marcas de agua en sus textos de Claude… el problema ya es prácticamente historia tan solo un día después", escribió un especialista en IA, acompañando el mensaje con una imagen de Meyer liberándose de unas cadenas y de pie sobre banderas arrugadas de la UE y de Anthropic.

Meyer y otros comenzaron a investigar cómo funciona el sistema de marcas de agua después de que Anthropic anunciara la semana pasada que Claude lo adoptaría para cumplir con la Ley de IA de la Unión Europea.

El problema de las marcas de agua

Algunos intentan eludir las marcas de agua porque no están de acuerdo con la idea de que todo el contenido generado por IA deba etiquetarse como tal, explicó Meyer a WIRED, mientras que otros, incluido él mismo, afirman que simplemente disfrutan del reto técnico. Los redactores de contenido autónomos y los creadores de redes sociales también se han puesto en contacto con Meyer para pedirle ayuda con el código.

Las nuevas normas, que entraron en vigor a principios de este mes, estipulan que los proveedores de modelos como Anthropic y OpenAI deben etiquetar el audio, las imágenes, los videos o los textos sintéticos para que una máquina pueda detectar este material como generado por IA; de lo contrario, se enfrentan a multas de hasta el 3% de su facturación anual. Aunque las normas establecen que los proveedores no pueden comercializar herramientas de elusión, no existe ninguna restricción legal sobre las herramientas independientes.

"No estoy en contra de la transparencia, de hecho, estoy a favor de la atribución de contenidos. Simplemente creo que las marcas de agua en sí mismas son una solución realmente mala, porque presentan importantes inconvenientes y riesgos", argumenta Meyer. Le preocupa el riesgo de falsos positivos y que las marcas de agua no distingan entre un uso ligero o intensivo de la IA, sobre todo porque, como hablante nativo de francés, suele utilizar Claude y otras herramientas de IA como Grammarly para editar sus textos. Usar la marca de agua como prueba podría llevar a decisiones injustas. Incluso Anthropic admite que su sistema solo puede estimar la probabilidad de que un texto haya sido generado o modificado por Claude. Aun así, una empresa podría rechazar a un candidato o un investigador podría enfrentar acusaciones exageradas simplemente porque el detector marcó su texto, afirma.

Anthropic marca el texto de forma invisible dejando un patrón en la elección de palabras y frases de Claude que es imperceptible para un lector humano, pero que sería detectable por una máquina que sepa cómo buscarlo. Dado que esto influye en el resultado de Claude, a algunos usuarios les preocupa que esto degrade la calidad de las respuestas de Claude, aunque Anthropic insiste en que no será así. La técnica SynthID fue desarrollada por Google, que la utiliza desde 2023 para incorporar marcas de agua a su contenido generado por IA. El informático Scott Aaronson propuso un método similar cuando trabajaba en OpenAI, pero afirma que la empresa nunca lo implementó porque le preocupaba que las marcas de agua alejaran a los clientes de su producto.

Claude etiquetado

Anthropic incorporará una marca invisible en los textos procesados por Claude para identificar el uso de IA, aunque el etiquetado puede perderse tras ediciones, paráfrasis o traducciones.

Otras formas de marcar el contenido de IA

El método de eliminación de Meyer usa un gran modelo de lenguaje (LLM) que no aplica marcas de agua para generar múltiples reescrituras, sustituyendo palabras por sinónimos y reorganizando ligeramente el contenido. Por supuesto, esto depende del uso de otros modelos de lenguaje a gran escala que no inserten marcas de agua, lo que quizá no sea una apuesta segura, ya que 190 organizaciones, entre ellas los proveedores OpenAI, Microsoft y Meta, han firmado el código de prácticas de transparencia de la UE. Queda por ver cuántos de estos laboratorios van a implementar sus marcas de agua, que deben incluirse en todos los nuevos modelos lanzados a partir de agosto y deben integrarse en los modelos existentes antes de diciembre.

Aunque no hay certeza de que esta herramienta funcione hasta que Anthropic publique el software que utiliza para detectar una marca de agua, comprender el enfoque básico de SynthID-text en el que se basa el sistema de marcas de agua de Claude los hace estar bastante seguros de que el método funciona, afirma Wayne Pan, director tecnológico y cofundador de Haimaker, una startup de IA con sede en Silicon Valley. Incorporó la herramienta de código abierto de Meyer a su plataforma porque, al igual que él, no le gustaba la idea de que Claude marcara con una marca de agua el contenido, incluso cuando solo se hubiera editado ligeramente, y no estaba de acuerdo con que la marca de agua fuera invisible para el usuario.