Claude Opus 4.5 marca un avance importante en la resistencia a las inyecciones de prompt cuando los agentes actúan dentro del navegador. Anthropic anuncia que la extensión Claude para Chrome pasa de research preview a beta para usuarios del plan Max, pero también recuerda que el problema sigue activo y que la web es un entorno adversarial donde hay que seguir trabajando.
Qué es la inyección de prompt y por qué el navegador es tan vulnerable
¿Te imaginas pedirle a un agente que lea tus correos y que, sin que lo notes, un mensaje lo instruya para enviar información a un tercero? Eso es una inyección de prompt: instrucciones adversarias escondidas dentro del contenido que el modelo procesa.
En el navegador el riesgo se amplifica por dos razones claras. Primero, la superficie de ataque es enorme: páginas, documentos embebidos, anuncios, scripts dinámicos, formularios. Segundo, los agentes de navegador realizan muchas acciones - navegar, llenar formularios, hacer clic, descargar archivos - que un atacante puede manipular si logra influir en el comportamiento del agente.
Un ejemplo concreto: un correo con texto en color blanco o una imagen manipulada que contiene instrucciones ocultas. El usuario no lo ve, el agente sí, y si el agente no detecta la trampa, puede filtrar información o ejecutar pasos no deseados.
Qué logró Anthropic con Claude Opus 4.5
Anthropic presenta mejoras en dos frentes: robustez del modelo y salvaguardas operativas. Evaluaron la extensión frente a un atacante interno adaptativo Best-of-N que combina técnicas conocidas de prompt injection. El nuevo modelo, Claude Opus 4.5, reduce significativamente la tasa de éxito de esos ataques. Anthropic reporta resultados donde una tasa de éxito del 1% es una mejora importante, pero no una solución definitiva.
Una tasa de éxito del 1 por ciento sigue representando riesgo real en escenarios de alto valor.
Los ejes de trabajo fueron:
-
Entrenamiento orientado a robustez. Usan aprendizaje por refuerzo para que Claude aprenda a identificar y rechazar instrucciones maliciosas en contenido simulado de web. Se recompensa al modelo cuando detecta y se niega a obedecer instrucciones adversarias, incluso si estas parecen autoritarias o urgentes.
-
Clasificadores antes y durante la inferencia. Todo contenido no confiable que entra en la
context windowse escanea con clasificadores que buscan patrones de inyección: texto oculto, imágenes manipuladas, elementos de interfaz engañosos. Cuando se detecta riesgo, se ajusta el comportamiento del modelo mediante una política de intervención. -
Red teaming humano a escala. Investigadores de seguridad internos y ejercicios externos tipo Arena ayudan a descubrir vectores creativos que los sistemas automáticos no ven. El trabajo humano es clave para encontrar nuevas técnicas de ataque.
-
Mejoras de producto. La extensión de Chrome incorpora esas mejoras y controles; ahora es beta para usuarios Max, lo que facilita pruebas más amplias y feedback real.
Aspectos técnicos importantes
-
El uso de
RLpara robustez implica exponer al modelo a ataques simulados durante entrenamiento y optimizar recompensas por comportamiento seguro. -
Los clasificadores actúan como una capa de defensa previa: detectan anomalías en la entrada y pueden invocar una intervención que cambie la instrucción que llega al modelo principal.
-
La evaluación con un atacante
Best-of-Nrefleja una estrategia adaptativa que intenta múltiples técnicas y combina las que funcionan, una forma más realista de medir resiliencia. -
La métrica de tasa de éxito de ataque es útil, pero debe interpretarse en contexto: 1% puede ser aceptable para tareas de bajo riesgo, y peligroso para operaciones que manejan secretos o acciones financieras.
Recomendaciones prácticas para desplegar agentes en navegadores
Si vas a integrar agentes que navegan o interactúan con la web, ¿qué medidas deberías tomar ahora mismo?
-
Limita el alcance y privilegios del agente: aplica el principio de menor privilegio. No des más permisos de los estrictamente necesarios.
-
Sanitiza y prefiltra contenido antes de procesarlo con el modelo. Usa clasificadores para bloquear o marcar entradas sospechosas.
-
Implementa confirmaciones humanas para acciones sensibles: exfiltrar datos, realizar transferencias, publicar información.
-
Mantén auditoría y registros de acciones del agente: quién pidió qué, qué páginas visitó y qué decisiones tomó.
-
Realiza red teaming y pruebas adversarias periódicas. Combina herramientas automáticas con equipos humanos para encontrar vectores creativos.
-
Actualiza modelos y clasificadores con frecuencia. Las técnicas de ataque evolucionan y las defensas deben hacerlo también.
-
Considera límites operacionales: número de clics automáticos, formularios completados, descargas permitidas.
El camino por delante
La investigación de Anthropic muestra progreso real: entrenar modelos para resistir instrucciones adversarias, emparejarlos con clasificadores y someterlos a red teaming da resultados que mejoran la seguridad. Sin embargo, la web sigue siendo un entorno adversarial y no existe una bala de plata.
¿Significa eso que no deberíamos usar agentes del navegador? No. Significa que hay que hacerlo con diseño, controles y vigilancia. Los avances como Claude Opus 4.5 son pasos importantes, pero la responsabilidad de desplegar con seguridad recae en equipos de producto, seguridad y operadores.
Si trabajas en esto, participar en ejercicios de robustez y colaborar con equipos de investigación es una de las formas más eficaces de mejorar la seguridad colectiva.
Fuente original
https://www.anthropic.com/research/prompt-injection-defenses
