El cerebro defensivo: por qué Claude + Foundation-Sec-8B + RAG
Un agente de IA que analiza eventos de seguridad es tan bueno como el modelo que lo respalda y el conocimiento al que puede acceder. Elegimos ambos por benchmarks reales, y aprendimos una idea que ahorra mucho dinero.
El problema: no todos los modelos son buenos en ciberseguridad
Es fácil suponer que «el modelo más inteligente» es el mejor en todo. En ciberseguridad, eso no es cierto. El análisis de incidentes requiere un bucle de iteración: escribir una consulta, leer los resultados, corregir y volver a intentarlo. Algunos modelos destacan en esto y otros se desmoronan, y no siempre es el modelo «más fuerte».
Qué comparamos — benchmarks, no bombo
Nos apoyamos en dos fuentes primarias: CTI-REALM de Microsoft (50 tareas contra simulaciones de ataque reales) y CyberSOCEval de Meta/CrowdStrike (609 casos validados por expertos). Surgieron dos ideas contraintuitivas:
- Claude lidera en trabajo agéntico — gracias al bucle de iterar y refinar, donde alcanzó 0,86–0,92 mientras los competidores caían por debajo de 0,50.
- El modo de razonamiento caro no mejora el análisis de ciberseguridad — a diferencia de las matemáticas y el código. Los modelos no se entrenaron para «pensar» sobre el análisis de seguridad, así que pagar por reasoning-high en el triaje es un desperdicio.
Qué elegimos — enrutamiento inteligente, no un único modelo
| Modelo | Función | Por qué |
|---|---|---|
| Claude (Sonnet/Opus) | Triaje agéntico + redacción de informes de incidentes | Clasificado 1–3 en CTI-REALM |
| Foundation-Sec-8B (Cisco) | El trabajador barato y privado: CVE→CWE, preguntas de ATT&CK | Calidad ~70B en tamaño 8B, se ejecuta en nuestra infraestructura |
| Workers AI (en el edge) | Embeddings + triaje por defecto | Gratis, se mantiene dentro del inquilino de Cloudflare |
El enrutamiento ahorra dinero y preserva la privacidad: la mayor parte del trabajo se ejecuta en modelos gratuitos/abiertos, y solo los casos más difíciles se enrutan al Claude de pago.
Y por qué RAG — y no fine-tuning
El conocimiento de ciberseguridad cambia cada día: nuevos CVE, nuevas técnicas de ataque, nuevos IOC. No puedes reentrenar un modelo con eso. Así que la base es RAG: incrustamos las bases de conocimiento públicas (MITRE ATT&CK, D3FEND, Sigma, feeds de amenazas) en un almacén vectorial, y el agente recupera la técnica relevante, la contramedida correspondiente y la regla de detección en tiempo real.
El fine-tuning se reserva solo para dos transformaciones concretas donde RAG llega a su techo: generar reglas Sigma y mapear una técnica a ATT&CK, donde un pequeño modelo abierto ajustado supera incluso a los modelos gigantes.
Los cuatro anclajes — y todos son legales comercialmente
Elegimos deliberadamente fuentes abiertas que pueden incrustarse en un producto de pago: MITRE ATT&CK + D3FEND (técnica↔contramedida), Sigma (reglas de detección, licencia DRL) y Atomic Red Team (MIT) como generador de ejemplos. Vigilamos las minas de licencia: algunos conjuntos de datos académicos solo están permitidos para investigación y no pueden incrustarse en un producto, así que los mantenemos separados.
Privacidad: un «modo privado» para clientes sensibles
Los registros de una empresa son datos sensibles. Por eso, por defecto se ejecuta sobre Workers AI (los datos se quedan dentro del inquilino de Cloudflare), y antes de cualquier salto a una API externa hay un paso de saneamiento de PII. Los clientes más sensibles obtienen un «modo privado» anclado al Foundation-Sec-8B que nosotros mismos alojamos, y los datos no salen en absoluto de nuestro perímetro.
Cómo lo seguimos mejorando: control de calidad continuo
Un modelo de IA que ejecuta acciones también es una superficie de ataque. Por eso: (1) guardarraíles deterministas fuera del LLM —una política que intercepta acciones destructivas, de modo que una inyección en el LLM no pueda ampliar el daño—. (2) Un red-team nocturno contra nuestro agente (prompt-injection/jailbreak) que ejecuta pruebas de regresión y hace fallar el despliegue si una defensa se rompe. (3) La clasificación de modelos se reevalúa contra nuevos benchmarks: el enrutamiento se actualiza cuando aparece un modelo mejor. La decisión está viva.
Este artículo describe la arquitectura de IA y las consideraciones de selección. Los números de los benchmarks son válidos a fecha de 2026 y deben verificarse contra la fuente. No hay aquí claves de API, secretos ni prompts internos.
← Todos los artículos