
OpenAI anunciou unha nova estratexia para cumprir as esixencias da Lei de Intelixencia Artificial da Unión Europea en materia de procedencia dos contidos xerados por IA. Nas vindeiras semanas, ChatGPT e Codex comezarán a incorporar unha marca de auga estatística invisible aos textos xerados na UE, mentres que os clientes da API poderán activar voluntariamente esta función a partir de hoxe en determinados modelos.
A medida responde ao requisito da normativa europea de que o texto xerado por sistemas de IA sexa identificable mediante medios lexibles por máquinas. OpenAI salienta, con todo, que as tecnoloxías actuais de marca de auga e detección de texto aínda presentan limitacións importantes.
A tecnoloxía empregada recibe o nome de textGrain e introduce un sinal estatístico invisible a través da elección das palabras realizada polo modelo. Un detector pode analizar posteriormente un texto para determinar se contén ese sinal. OpenAI asegura que nas súas probas textGrain igualou ou superou o comportamento doutras solucións avaliadas, entre elas SynthID para texto, aínda que advirte de que os resultados obtidos en condicións controladas non garanten unha detección fiable en situacións reais.
A eficacia depende especialmente da extensión e do tipo de texto. Cunha taxa de falsos positivos fixada no 1 %, o detector identificou a marca en arredor do 80 % dos textos de 200 tokens e en aproximadamente o 95 % dos de 400 tokens en probas sobre cuestións de psicoloxía. En matemáticas, onde existe menos liberdade na elección das palabras, as taxas de detección foron considerablemente inferiores.
As modificacións do texto tamén poden debilitar o sinal. Nunha proba con textos de 400 tokens, substituír o 10 % das palabras por sinónimos reduciu a detección desde aproximadamente o 92 % ata o 66 %. Cunha modificación do 25 %, a taxa caeu ata o 17 %.
OpenAI afirma que a incorporación da marca de auga non produce diferenzas significativas no rendemento dos modelos. Nas probas realizadas con Astra, o seu modelo máis avanzado, os resultados con e sen watermarking mantivéronse próximos en diferentes avaliacións, incluíndo tarefas de programación, razoamento, investigación e navegación web.
A compañía de Sam Altman tamén quere deixar claro que a detección dunha marca de auga non permite determinar quen escribiu realmente un texto nin que papel tivo a IA no proceso. Un resultado positivo non mide a achega humana, non determina a propiedade ou responsabilidade sobre o contido e tampouco identifica o usuario, a conta, a petición ou a conversa que deu lugar ao texto.
Do mesmo xeito, a ausencia dunha marca de auga tampouco demostrará que un texto sexa de autoría humana. Un contido pode resultar indetectable por ser demasiado curto, por sufrir edicións ou traducións, por proceder dun modelo non compatible ou por ter sido xerado con ferramentas doutras empresas.
O acceso ao detector estará inicialmente restrinxido a investigadores e organizacións especializadas que soliciten participar no programa de avaliación. OpenAI optou por non facelo público de inmediato debido precisamente ao risco de falsos positivos e falsos negativos. O sistema indicará se detecta unha marca de auga de OpenAI, pero non revelará a identidade do usuario nin as súas peticións ou conversas.
A estratexia forma parte dun sistema máis amplo de procedencia de contidos que xa inclúe mecanismos específicos para imaxes e audio. OpenAI emprega Content Credentials nos resultados de imaxe compatibles, segue o estándar C2PA e incorpora marcas de auga invisibles SynthID en determinados contidos visuais e sonoros. Tamén ofrece ferramentas de verificación para estes formatos.
A diferenza respecto das imaxes e do audio está na maior facilidade coa que o texto pode ser reescrito, traducido ou editado sen deixar rastros evidentes. OpenAI prevé, polo tanto, continuar investigando como manter as marcas de auga fronte a estas modificacións e como diferenciar de forma máis precisa entre asistencia da IA e autoría da IA.

