Estamos trabajando con químicos sintéticos, computacionales y analíticos para hacer que Claude sea mejor en química. En esta entrega, Anthropic publica su primer trabajo en este esfuerzo: evaluar cómo Claude maneja la entrada analítica más común en química orgánica, un espectro de RMN.
Resumen del experimento
¿Por qué importa esto para ti, químico o curioso de la IA? Porque gran parte del trabajo químico diario consiste en traducir entre representaciones: un dibujo a mano, un SMILES, una tabla de picos o el texto de un método. Cada representación exige una fluidez distinta. Un modelo que pueda leer y cruzar estas señales acelera desde la identificación de compuestos hasta la integración de resultados publicados.
Anthropic comparó tres modelos Claude (Opus 4.7, Opus 4.6, Sonnet 4.6) frente a dos programas dedicados de NMR: ChemDraw y MestReNova. La prueba usó 20 compuestos tomados de preprints en ChemRxiv publicados después del corte de entrenamiento de los modelos, para evitar sesgos de selección. Los 20 compuestos se organizaron en cuatro familias estructurales, cinco por familia, cada una representando un tipo distinto de desafío en RMN.
Metodología técnica
- Entrada: cada herramienta recibió la estructura en
SMILESy la instrucción de predecir posiciones de picos para hidrógeno y carbono en 1D NMR, usando el mismo solvente que el paper original. - Medición: cada pico predicho se emparejó con su contraparte experimental y se midió la diferencia en
ppm. - Umbrales de corrección: ±0.20 ppm para hidrógeno y ±1.0 ppm para carbono, ventanas que un químico consideraría correctas.
- Repetibilidad: cada modelo Claude se consultó tres veces por compuesto y se promediaron los resultados; ChemDraw y MestReNova son deterministas y se ejecutaron una vez.
¿Por qué este diseño importa? Porque los LLMs generan variabilidad entre corridas; promediar permite comparar su rendimiento establecido contra software tradicional.
Resultados cuantitativos principales
- Hidrógeno: Opus 4.7 fue el más preciso, con error medio ±0.079 ppm, menos de la mitad del umbral aceptable.
- Carbono: Opus 4.7 y MestReNova quedaron virtualmente empatados, con ±1.37 ppm y ±1.48 ppm respectivamente. Opus 4.6 quedó en posición intermedia y Sonnet 4.6 fue el menos preciso.
- Un caso difícil: un protón NH en la familia de cloropiridazinas. Opus 4.7 lo ubicó ligeramente bajo pero consistente; Opus 4.6 mostró dispersión; Sonnet 4.6 lo puso muy alejado (10-13 ppm), fuera de lo esperado.
- Forma y separación de picos: Opus 4.7 coincidió con el patrón de acoplamiento más a menudo que las demás herramientas. Los tres modelos Claude predijeron la separación entre subpicos dentro de 0.5 Hz aproximadamente 80% de las veces, frente a 26-35% para ChemDraw y MestReNova.
- Consistencia: Opus 4.7 fue el más estable entre sus tres corridas, con menor variación entre ejecuciones.
El problema inverso: deducir estructura desde espectros
La tarea más dura es la inversa: partir del espectro y proponer la estructura. Se presentaron 15 problemas a Opus 4.7, tres corridas por problema, pidiendo hasta tres candidatos por intento. Se dio la fórmula molecular (desde espectrometría de masa de alta resolución) y las listas 1D de picos de H y C.
- Objetivos sencillos (8 blancos, anillos simples o dos fragmentos): Opus 4.7 recuperó las 8 estructuras en todas las corridas con solo fórmula y espectros.
- Objetivos difíciles (7 blancos: anillos fusionados, espirales, etc.): se añadió una pista extra, la estructura del material inicial. Con ese apoyo, Opus 4.7 devolvió la estructura correcta en las tres corridas para 4 de los 7, y en dos de tres para los restantes.
Esto muestra que un modelo generalista sin fine-tuning específico en química puede hacer elucidación 1D razonablemente bien con la información que un químico normalmente pegaría en un chat.
Limitaciones y consideraciones técnicas
No todo es perfecto ni definitivo:
- Tamaño de la muestra: 20 compuestos es informativo pero pequeño. Idealmente se evaluaría con cientos de compuestos cubriendo 20-30 clases de andamiaje, con al menos 15 por clase para separar la varianza intraclase de las diferencias entre herramientas.
- Químicas no probadas: sería útil evaluar NH activos en heteroaromáticos más allá de cloropiridazinas, solventes no testeados, y versiones que incluyan experimentos 2D.
- Datos: muchos resultados negativos y datos útiles están dispersos, en formatos inconsistentes o tras paywalls. La escasez y el ruido de datos siguen siendo cuellos de botella para avances más rápidos.
- Alcance: herramientas dedicadas de elucidación han existido por décadas y suelen usar
2D NMRpara resolver ambigüedades. Claude hace mucho desde 1D y fórmula, pero para casos complejos probablemente necesitarás 2D y juicio humano.
¿Qué significa esto en la práctica?
- Para el químico de laboratorio: Claude (Opus 4.7) puede ayudarte a predecir espectros y a identificar candidatos estructurales rápidamente, reducir la carga de trabajo repetitivo y plantear hipótesis a chequear con experimentos.
- Para grupos académicos y PYMEs: abre la posibilidad de integrar un asistente multimodal que lee figuras, texto y listas de picos sin la fricción de convertir todo a bases de datos propietarias.
- Para desarrolladores de herramientas: demuestra que modelos generalistas multimodales ya compiten con software especializado en muchas tareas de predicción 1D, y que focalizar mejoras en puntos clave (solventes, NH activos, 2D) puede aumentar la adopción.
Próximos pasos y colaboración
Anthropic señala que seguirá extendiendo la utilidad de Claude en química y comparte las prioridades: mejorar bottlenecks que frenan a los químicos, extender benchmarks, e identificar dónde Claude puede ahorrar tiempo y dónde no.
Si trabajas en un problema donde Claude podría ayudar - especialmente si tu trabajo involucra razonamiento multimodal - Anthropic invita a investigadores a contactarlos en scienceblog@anthropic.com o vía la aplicación AI for Science.
Reflexión final
No estamos en la era de IA que sustituye al químico; estamos en la era en que la IA hace alcanzables tareas de traducción, búsqueda y primera criba que consumían tiempo valioso. Claude no reemplaza la intuición experimental ni la verificación, pero sí comienza a ser una herramienta práctica que acelera la identificación y validación de estructuras. ¿Te imaginas ahorrar horas por compuesto en tu flujo de trabajo de síntesis? Eso ya es posible en casos concretos, y la dirección es clara: combinar mejores datos, más diversidad de pruebas y colaboración con químicos de verdad.
