Un modelo de inteligencia artificial de Anthropic, el Claude Haiku 4.5, rellenó y envió por su cuenta un formulario de denuncia en la web oficial de la Policía de Filadelfia dedicada a casos de homicidio sin resolver. El episodio ocurrió el 18 de julio de 2026 durante una evaluación automatizada en la que el sistema interactuaba con páginas web seleccionadas al azar.
Según el informe que Anthropic publicó el pasado 10 de octubre, el modelo aterrizó en PhillyUnsolvedMurders.com y, al encontrarse con un formulario de pistas, generó un texto inventado. El mensaje decía, en esencia, que el remitente “podría tener información sobre el caso” y que “recordaba haber visto a alguien que coincidía con la descripción en la zona de [la calle indicada en la página] durante ese período”, pidiendo que le contactaran si resultaba relevante. La página no incluía ninguna descripción del presunto autor, y el modelo dejó en blanco los campos de nombre y datos de contacto, algo que el formulario permitía.
We’re beginning a process of publishing more frequent reports on model behavior, beyond what appears in our system cards and regular risk reports.
Today’s report describes four types of behaviors we’ve identified during evaluations and internal use. In each, Claude acted on real websites or systems in ways we didn’t intend, sometimes by working around a restriction instead of stopping.
All cases had minimal real-world impact. From an alignment and security perspective, we consider these behaviors significantly less severe than the cybersecurity incidents we reported in July and September.
Read the full report: https://t.co/mGeVIBgdou
— Anthropic (@AnthropicAI) October 9, 2026
Las instrucciones de la prueba le prohibían iniciar sesión, crear cuentas, introducir datos personales, realizar compras o enviar “cualquier cosa destructiva”, pero no contemplaban de forma explícita la prohibición de rellenar y enviar formularios. Anthropic señala que el modelo parecía estar generando contenido de ejemplo para completar la tarea, más que intentar engañar deliberadamente.
La empresa detectó el envío el 28 de septiembre y avisó a las autoridades de Filadelfia el 7 de octubre. Al día siguiente se reunieron con representantes del departamento. La policía localizó el registro en su sistema: había quedado marcado como spam y nunca se reenvió al Real-Time Crime Center ni se sometió a revisión investigativa. No hay indicios de acceso no autorizado a sistemas policiales ni de compromiso de datos.
El Departamento de Policía de Filadelfia calificó de inaceptable el retraso de más de dos meses en la detección y notificación. Tras el incidente, Anthropic reforzó las restricciones de acceso a internet durante las pruebas, ajustó evaluaciones para evitar interacciones con webs reales y añadió mecanismos de supervisión adicionales. La compañía remitió a su informe público cuando se le pidieron comentarios.

