Anthropic anunció una alianza con Accenture para evaluar de forma independiente sus modelos de inteligencia artificial más avanzados. La iniciativa busca que especialistas externos observen cómo se entrenan, protegen y despliegan estos sistemas desde dentro de la compañía.
Evaluadores independientes dentro de Anthropic
El programa será liderado por Faculty, la división especializada en inteligencia artificial de Accenture. Su trabajo incluirá evaluar modelos, realizar pruebas de seguridad conocidas como red-teaming, analizar su alineación y comprobar si las medidas de protección funcionan como deberían.
¿La diferencia frente a una auditoría tradicional? Los evaluadores integrados tendrán un nivel de acceso comparable al de un empleado. Esto les permitirá seguir decisiones durante el entrenamiento, conversar directamente con los equipos y observar cómo evolucionan los modelos antes de llegar al público.
Desde esa posición, podrán identificar puntos ciegos, comprobar si Anthropic cumple sus compromisos de seguridad y reportar incidentes. También podrían ofrecer al público una visión más clara sobre los beneficios y riesgos de la IA avanzada.
La evaluación independiente no elimina la responsabilidad de Anthropic sobre sus modelos. Su objetivo es hacer esa responsabilidad más verificable.
Una inversión de mil millones de dólares
Anthropic y Accenture esperan invertir al menos 1.000 millones de dólares cada una durante los próximos cinco años para desarrollar capacidades en esta área.
La inversión llega en un momento en el que los modelos de frontera, aquellos sistemas con capacidades cada vez más amplias y avanzadas, requieren controles que vayan más allá de las pruebas internas. No basta con preguntar si un modelo funciona. También es necesario entender cómo puede fallar y si sus salvaguardas resisten situaciones inesperadas.
Accenture aportará, además, experiencia observando cómo empresas y gobiernos utilizan la IA en sectores muy distintos. Ese conocimiento práctico puede ayudar a evaluar los modelos no solo en laboratorios, sino también en escenarios cercanos a su uso real.
Un sistema que todavía está tomando forma
Anthropic reconoce que la evaluación integrada aún no cuenta con reglas comunes. Todavía no existe un estándar que defina qué información deben recibir los evaluadores, cómo deben comunicar sus hallazgos o quién debería financiar su trabajo a largo plazo.
La empresa considera que, con el tiempo, los recursos deberían provenir de fondos compartidos o de gobiernos. Por ahora, financiará directamente el trabajo de Accenture y conversa con METR y otras organizaciones sin fines de lucro para probar distintos elementos del modelo con sus propios recursos.
Esto plantea una pregunta importante: ¿puede un evaluador seguir siendo independiente si recibe financiación de la misma empresa que analiza? Anthropic asegura que está explorando diferentes mecanismos mientras se construye un ecosistema con varias organizaciones y estándares compartidos.
Una alianza no exclusiva
El acuerdo no es exclusivo. Anthropic afirma que trabajará con otros evaluadores, cuyos nombres espera anunciar próximamente. Accenture, por su parte, también colaborará con otros desarrolladores de inteligencia artificial.
La idea es evitar que una sola organización tenga el control de la evaluación de los modelos más potentes. Un sistema con varios equipos independientes podría ofrecer comparaciones más útiles, detectar problemas que una revisión interna no encuentra y aumentar la confianza pública.
La propuesta todavía está en una etapa inicial, pero marca un cambio relevante: los evaluadores no solo revisarían un producto terminado, sino que acompañarían su creación desde dentro. En una industria que avanza con rapidez, esa supervisión podría ayudar a detectar riesgos antes de que lleguen a millones de personas.
Anthropic continuará entrenando y lanzando modelos de frontera mientras desarrolla este programa. La compañía también promete compartir cómo evoluciona su enfoque a medida que incorpore nuevos evaluadores y el sector establezca mejores prácticas.
Fuente original
https://www.anthropic.com/news/accenture-embedded-evaluation
