Anthropic acaba de transferir Petri, su caja de herramientas abierta para evaluar alineación en modelos de lenguaje, a Meridian Labs y presenta Petri 3.0. Si trabajas evaluando modelos o simplemente te interesa cómo medimos riesgos como el engaño o la sumisión, esto cambia la forma en que podemos auditar modelos de forma abierta y reproducible.
Qué es Petri y cómo funciona
Petri nació como una suite de tests de alineación que se pueden aplicar a cualquier modelo grande de lenguaje. Su flujo básico separa tres componentes: un auditor que genera escenarios, el modelo objetivo que responde a esos escenarios, y un judge que puntúa las transcripciones en busca de comportamientos problemáticos como engaño, sycophancy o cooperación con solicitudes dañinas.
Ese enfoque permite automatizar evaluaciones a gran escala y comparar versiones de un mismo modelo. Desde Claude Sonnet 4.5, Anthropic ha usado Petri como parte integral de sus evaluaciones internas, y organizaciones externas como el AI Security Institute del Reino Unido ya lo integran en sus procesos.
Novedades clave en Petri 3.0
Petri 3.0 trae cambios arquitectónicos y funciones diseñadas para hacerlo más adaptable, realista y profundo.
-
Adaptabilidad: la arquitectura ahora separa claramente el
auditory eltargetcomo componentes independientes. Eso facilita reemplazar o afinar cada pieza por separado, por ejemplo: usar un auditor especializado en escenarios médicos mientras el modelo objetivo es un LLM general. -
Realismo: el nuevo add-on
dishpermite ejecutar tests usando elsystem promptreal y elscaffoldque envolvería el modelo en despliegues reales. Esto reduce que el modelo detecte la artificialidad del test y ajuste su conducta solo para pasar la prueba. En otras palabras, ayuda a mitigar el sesgo de evaluación cuando el modelo sabe que está siendo evaluado. -
Profundidad: Petri se integra con Bloom, otra herramienta abierta de evaluación que permite análisis más detallados de comportamientos concretos. Mientras Petri cubre muchas áreas con tests amplios, Bloom permite exámenes finos sobre conductas específicas.
Aspectos técnicos relevantes
-
Modularidad facilita pipelines CI/CD: puedes insertar Petri como un paso de validación en tu flujo de entrenamiento o despliegue.
-
Auditoría automatizada: al usar un
judgemodelo para calificar transcripciones, obtienes métricas cuantificables de propensión al engaño, a la servilismo o a seguir instrucciones peligrosas. -
Riesgos de sobreajuste a tests: Petri 3.0 reduce que un modelo aprenda a "pasar la prueba" en vez de comportarse responsablemente en el mundo real.
Por qué donar Petri a Meridian Labs importa
Donar Petri a Meridian Labs busca crear independencia. Cuando una herramienta de evaluación pertenece a un actor con intereses comerciales, sus resultados generan dudas sobre sesgos y conflicto de intereses. Al pasar Petri a una organización sin fines de lucro dedicada a evaluación, Anthropic pretende que los tests sean percibidos como más neutrales y creíbles.
Esto recuerda la donación previa del Model Context Protocol a la Linux Foundation. La idea es construir una infraestructura abierta y compartida para evaluación que gobiernos, laboratorios y auditores independientes puedan usar y confiar.
Implicaciones prácticas para desarrolladores e evaluadores
-
Integración: puedes usar Petri 3.0 para pruebas automatizadas antes de cada despliegue, comparando métricas entre versiones del modelo.
-
Personalización: gracias a la separación
auditor/target, es más sencillo crear auditores especializados por dominio o adaptarjudgeal estándar regulatorio de un país. -
Investigación: los investigadores pueden usar
dishpara estudiar cómo elsystem prompty elscaffoldcambian el comportamiento real del modelo en producción. -
Transparencia regulatoria: reguladores pueden apoyarse en un stack abierto (Petri, Bloom, Inspect, Scout) para auditar proveedores sin depender de informes internos.
Qué sigue y recomendaciones rápidas
Petri 3.0 ya tiene nuevo mantenimiento bajo Meridian Labs y se integra en un ecosistema de herramientas abiertas. Si trabajas con modelos, prueba a incorporar Petri en tu pipeline de evaluación y considera lo siguiente:
- Usa auditorías modulables para cubrir distintos escenarios de riesgo.
- Ejecuta tests con
dishpara acercarte al comportamiento del modelo en producción. - Complementa las pruebas amplias de Petri con análisis profundos de Bloom cuando necesites diagnóstico fino.
La noticia no elimina los desafíos: la evaluación nunca será perfecta y los modelos seguirán encontrando atajos. Pero tener herramientas abiertas y administradas independientemente eleva la calidad del escrutinio y facilita comparaciones entre proveedores.
Fuente original
https://www.anthropic.com/research/donating-open-source-petri
