OpenAI incorporará durante las próximas semanas marcas de agua invisibles en determinados textos generados por ChatGPT y Codex para usuarios elegibles de todos los planes en la Unión Europea (UE), como parte de su estrategia para cumplir con las obligaciones de transparencia de la Ley de Inteligencia Artificial del bloque.
La tecnológica estadounidense utilizará un sistema denominado textGrain, diseñado para introducir una señal estadística imperceptible para los lectores mediante las elecciones de palabras realizadas por sus modelos.
“Durante las próximas semanas, incorporaremos una marca de agua invisible a los textos elegibles generados por ChatGPT y Codex en la Unión Europea”, informó OpenAI.
La compañía explicó que el sistema permitirá posteriormente evaluar mediante un detector si un fragmento contiene una marca asociada con sus modelos.
API permitirá activar la marca de agua
Desde el 5 de octubre, clientes de la interfaz de programación de aplicaciones (API) de OpenAI en cualquier parte del mundo pueden activar voluntariamente las marcas de agua para determinados modelos.
La función permanecerá desactivada por defecto, por lo que cada cliente podrá decidir cómo utilizarla de acuerdo con sus necesidades y obligaciones de transparencia.
OpenAI también trabaja con proveedores de servicios de computación en la nube para ofrecer durante las próximas semanas la posibilidad de aplicar el marcado a las respuestas de sus modelos utilizadas mediante esas plataformas.
La implementación responde al artículo 50 de la Ley de Inteligencia Artificial de la Unión Europea, que establece obligaciones de transparencia para los proveedores de sistemas de IA generativa.
textGrain modifica la elección de palabras
A diferencia de una marca visible colocada sobre una imagen, textGrain incorpora una señal estadística invisible mediante las palabras seleccionadas por el modelo mientras construye una respuesta.
“Nuestra tecnología de marca de agua de texto, textGrain, añade una señal estadística invisible a las elecciones de palabras del modelo”, explicó OpenAI.
Posteriormente, un detector busca ese patrón para evaluar si un fragmento contiene una marca de agua de la compañía.
OpenAI indicó que textGrain igualó o superó en sus evaluaciones el rendimiento de otros métodos probados, incluido SynthID para texto. Sin embargo, advirtió que obtener buenos resultados en condiciones ideales no garantiza una detección confiable en situaciones cotidianas.
La tecnológica señaló que los detectores pueden cometer dos tipos de errores: identificar una marca inexistente, conocido como falso positivo, o no detectar una marca presente, denominado falso negativo.
Textos breves y ediciones dificultan la detección
Las pruebas de OpenAI muestran que la longitud y el tipo de contenido influyen considerablemente en la eficacia de textGrain.
Con una tasa objetivo de falsos positivos de 1%, el detector identificó marcas en alrededor de 80% de los pasajes de 200 tokens y en aproximadamente 95% de los textos de 400 tokens en contenidos como psicología.
Los resultados fueron considerablemente menores en áreas como matemáticas, donde existe menos flexibilidad en la elección de palabras.
Las modificaciones posteriores también pueden deteriorar considerablemente la señal. En pruebas realizadas con textos de 400 tokens, sustituir 10% de las palabras por sinónimos redujo la detección de aproximadamente 92% a 66%. Cuando se reemplazó 25% de las palabras, la tasa cayó hasta 17%.
“La ausencia de una marca de agua detectada no demuestra autoría humana”, precisó OpenAI.
La empresa explicó que un contenido generado con sus herramientas podría ser demasiado corto, haber sido editado o traducido, proceder de un modelo no compatible con textGrain, ser anterior a la implementación de las marcas o haber sido creado mediante herramientas de otra compañía.
Marca no identifica al usuario ni demuestra propiedad
OpenAI subrayó que detectar textGrain únicamente proporciona información limitada sobre la intervención de sus sistemas en determinado contenido.
La señal puede indicar que un sistema de OpenAI generó o procesó parte de un texto, pero no permite determinar cuánto criterio, edición o creatividad humana intervino posteriormente.
El sistema tampoco determina quién posee un texto, si su utilización fue legal, si existía obligación de revelar el uso de inteligencia artificial o quién es responsable de su publicación.
Además, la marca no permitirá identificar a la persona que utilizó ChatGPT o Codex ni asociar una organización, cuenta, instrucción o conversación con el contenido detectado. Tampoco funcionará como mecanismo para determinar si la información publicada es verdadera.
“Una marca de agua no identifica al usuario. No asocia a una persona, organización, cuenta, prompt o conversación con el texto”, explicó la empresa.
Detector tendrá acceso restringido
OpenAI decidió no poner inicialmente el detector de textGrain a disposición del público debido al riesgo de falsos positivos y marcas que podrían pasar inadvertidas.
Investigadores y organizaciones especializadas aprobadas pueden solicitar acceso desde el 5 de octubre. Las autorizaciones se concederán inicialmente caso por caso para contribuir a evaluar y mejorar la tecnología.
La herramienta únicamente reportará si detecta una marca de agua de OpenAI, sin identificar al usuario ni revelar sus instrucciones o conversaciones.
La compañía también planea publicar textGrain como tecnología de código abierto para que otros investigadores y desarrolladores puedan construir nuevas herramientas a partir del sistema.
OpenAI continuará estudiando cómo las marcas resisten procesos de edición y traducción, así como mecanismos que permitan diferenciar con mayor precisión entre asistencia de inteligencia artificial y autoría mediante IA.
