Cuando estalló GrantaGate —el cuento ganador que lectores señalaron como escrito por una IA— quedó clara una pregunta urgente: cuando un modelo escribe, ¿de dónde salen sus palabras? ¿Son nuevas o repiten lenguaje que el modelo ya vio durante su entrenamiento?
Qué es infini-gram y qué permite hacer
infini-gram es un motor de búsqueda a escala desarrollado por Ai2 que indexa enormes conjuntos de texto y cuenta cuántas veces aparece una frase de cualquier longitud en esos corpus. En lugar de limitarse a decir si un pasaje es probablemente generado por máquina, infini-gram permite señalar dónde y con qué frecuencia aparecen fragmentos del texto en recursos públicos.
¿Para qué sirve eso en la práctica? Para convertir un puntaje de detector en evidencia textual. Si un detector te dice "esto parece sintético", infini-gram te puede mostrar los trozos de frase que también aparecen en libros, blogs o sitios donde el modelo pudo haberse entrenado.
Metodología técnica que usó el equipo de Chakrabarty
Tuhin Chakrabarty y su equipo cruzaron varios recursos: el índice de infini-gram, una instantánea web que ese índice incluye, y Google Books. Buscaron expresiones multi-palabra raras y definieron criterios técnicos para separarlas de frases comunes de uso corriente.
- Una expresión se consideró rara si aparece en no más de cinco volúmenes de Google Books y no aparece en la instantánea web de
infini-gram. - Con eso aislaron frases más asociadas a libros publicados que a lenguaje difundido ampliamente en la web.
La idea: si un texto detectado como generado por IA contiene muchas de esas expresiones raras —repartidas por el libro— eso actúa como evidencia circunstancial de que el modelo está rescatando lenguaje específico de libros.
Ejemplo concreto
El equipo procesó el cuento del escándalo (GrantaGate) con infini-gram. Fragmentos distintivos, como "sour tang of fermenting", aparecieron en otros lugares indexados, por ejemplo en un sitio de fan-fiction. No es una prueba concluyente de copia literal, pero sí una señal clara de que el texto comparte formulaciones muy específicas con otras fuentes.
Resultados cuantitativos clave
El estudio comparó conjuntos de libros autoeditados y bestsellers en Amazon con y sin alto puntaje de texto detectado como IA, y un conjunto de referencia de literatura premiada:
- Entre los 100 con mayores ingresos y con texto detectado como IA, las expresiones raras cubrieron el 43.2% del texto; en los 100 mejores sin detección de IA cubrieron 37.6%.
- Al ampliar a los 200 mejores, la diferencia se reduce a 4.4 puntos porcentuales a favor de los libros con texto detectado como IA.
- Comparando con el conjunto de literatura premiada, las expresiones raras cubrieron en promedio 19.1% del texto, frente a 37.2% (top ventas sin IA) y 41.6% (top ventas con IA). Aquí la brecha con la literatura premiada llega a 22.5 puntos.
Esos números sugieren que, al menos en ese subconjunto de bestsellers autoeditados, los libros con mayor detección de IA tienden a apoyarse más en frases distintivas ya presentes en libros previos.
Qué nos dice esto sobre detección y atribución
"Attribution is a very hard problem in machine learning, especially with LLMs," dice Chakrabarty.
Un detector devuelve una probabilidad; no te señala pasajes coincidentes ni su origen. infini-gram agrega una capa de evidencia textual: muestra coincidencias frase por frase y su frecuencia en corpus públicos. Pero hay límites importantes:
- Encontrar una frase rara en otros textos es evidencia circunstancial, no una prueba legal de copia directa.
- Los modelos suelen evitar repetir largos pasajes palabra por palabra tras el entrenamiento, pero sí pueden reutilizar fragmentos cortos aprendidos durante pretraining.
- La cobertura del corpus importa: si el origen no está indexado,
infini-gramno lo encontrará.
Técnicamente, esto significa que infini-gram ayuda a transformar un puntaje abstracto en evidencias accionables para investigación académica y para indagar posibles reproducciones derivadas del entrenamiento.
Aplicaciones prácticas y preocupaciones de derechos
- Investigación de copyright: el equipo ya experimenta rastreando a qué páginas en la web aparecen fragmentos de libros con derechos para ver si un modelo pudo haber sido entrenado con copias piratas o manuscritos filtrados.
- Verificación editorial: editores y plataformas pueden usar estas herramientas para inspeccionar si textos autoeditados reutilizan lenguaje distintivo de libros previos.
- Transparencia de modelos: proyectos abiertos como
OlmoTracey el índiceinfini-grampermiten reproducibilidad y auditoría, algo fundamental cuando de atribución y derechos hablamos.
Por qué importa que estas herramientas sean abiertas
Ai2 combina infini-gram con recursos abiertos como el entrenamiento de Olmo y conjuntos como Dolma. La apertura permite a investigadores replicar análisis, debatir metodología y empujar límites éticos y legales con datos a la vista.
Si la IA va a escribir en nuestra cultura, necesitamos herramientas públicas que nos permitan entender qué repite y qué aporta de nuevo.
Al final, infini-gram no proclama culpables; construye pistas. Y en un campo donde los puntajes de detectores eran hasta ahora lo más concreto que teníamos, pasar de una cifra a fragmentos rastreables cambia la conversación sobre originalidad, atribución y responsabilidad.
