Saltar al contenido
Enrique Tomás Martínez Beltrán
InicioInvestigaciónPublicacionesTemasDocenciaBlog
Contacto
EN/ES
InicioInvestigaciónPublicacionesTemasDocenciaBlogContacto
EN/ES

Enrique Tomás Martínez Beltrán

Investigación postdoctoral en IA, ciberseguridad y aprendizaje federado, con trabajo en análisis de amenazas, ciberdefensa de ciclo cerrado y aprendizaje descentralizado confiable.

  • Política de privacidad
  • Términos del servicio
  • Accesibilidad
  • Google Scholarse abre en una pestaña nueva
  • ORCIDse abre en una pestaña nueva
  • LinkedInse abre en una pestaña nueva
  • GitHubse abre en una pestaña nueva
Todos los perfiles
  • ResearchGatese abre en una pestaña nueva
  • Scopusse abre en una pestaña nueva
  • DBLPse abre en una pestaña nueva
  • Web of Sciencese abre en una pestaña nueva

Enrique Tomás Martínez Beltrán. Todos los derechos reservados.

Volver arriba

Este sitio carga analítica opcional de Google y proveedores externos de analítica solo si aceptas. Puedes rechazarla y seguir usando la web con normalidad.

  1. Inicio
  2. Notas de investigación sobre aprendizaje federado, ciberseguridad y ciberdefensa
  3. Cómo medir la robustez en experimentos DFL adversarios
Robust Machine LearningML adversarioCiberdefensaAprendizaje federado descentralizadoEvaluation

Cómo medir la robustez en experimentos DFL adversarios

Leer la calidad del modelo junto con comunicación, recursos y comportamiento ante fallos

Enrique Tomás Martínez Beltrán

Investigador postdoctoral en Informática

9 de agosto de 20269 min de lectura
  • LinkedInse abre en una pestaña nueva
  • Xse abre en una pestaña nueva
Cómo medir la robustez en experimentos DFL adversarios

La robustez en aprendizaje federado descentralizado debería medirse como respuesta a unas condiciones, no como una cifra aislada del experimento. Un modelo puede mantener un F1 alto mientras empeoran las comunicaciones, se saturan los recursos o un participante comienza a enviar actualizaciones envenenadas. Una buena evaluación hace visibles todas esas dimensiones.

Los experimentos de Flighter ofrecen una plantilla útil. Cuatro aeronaves simuladas equipadas con radar de apertura sintética colaboran en reconocimiento con VGG16, usando MSTAR, SAMPLE y OpenSARShip. El escenario incluye una línea base y varias perturbaciones operativas o adversarias. El valor de estos resultados está precisamente en que su alcance está definido.

Empezar por las métricas de tarea

Para una decisión binaria o one-vs-rest, las cantidades habituales son:

precision⁡=TPTP+FP,recall⁡=TPTP+FN,\operatorname{precision}=\frac{TP}{TP+FP}, \qquad \operatorname{recall}=\frac{TP}{TP+FN},precision=TP+FPTP​,recall=TP+FNTP​,

y:

F1=2precision⁡ recall⁡precision⁡+recall⁡.F_1=2\frac{\operatorname{precision}\,\operatorname{recall}} {\operatorname{precision}+\operatorname{recall}}.F1​=2precision+recallprecisionrecall​.

F1 es útil cuando importan tanto falsos positivos como falsos negativos, pero no describe la salud de la federación. Hay que leerlo junto a las medidas de red y de sistema.

Establecer una línea base reproducible

En las condiciones de referencia comunicadas para los tres conjuntos de datos, el estudio obtiene valores F1 del 95,8% para MSTAR, 97,5% para SAMPLE y 79,1% para OpenSARShip. No son una clasificación universal de los conjuntos ni una garantía para un despliegue. Son puntos de comparación para estudiar cuánto rendimiento se pierde cuando el entorno se altera.

La misma línea base registra aproximadamente un 57% de uso de CPU, 1,7 GB de RAM, un 0,7% de pérdida de paquetes y rondas de 5,3 segundos. Informar de estas cifras evita una comparación engañosa en la que el método de defensa parece mejor porque su coste de recursos queda oculto.

Perturbar el sistema de varias formas

La tesis distingue varias familias de estrés:

Manipulación del contexto

Cuando se manipula el geoposicionamiento, los valores F1 comunicados son 91,8% para MSTAR, 90,3% para SAMPLE y 72,0% para OpenSARShip. La pérdida de paquetes permanece por debajo del 1% en el experimento descrito. Este caso comprueba si el contexto operativo puede reducir el efecto de un nodo cuyo comportamiento ya no encaja con la misión.

Comportamiento de curso de colisión

En la manipulación de curso de colisión, los valores correspondientes son 92,5%, 89,8% y 70,1%. La reducción no es igual en todos los conjuntos, recordando que un mecanismo robusto interactúa con la distribución de datos y la dificultad de la tarea.

Poisoning

En los escenarios de poisoning, F1 oscila entre 52,1% y 90,1% según el conjunto de datos y la configuración del ataque. Un intervalo es más informativo que un promedio único porque muestra que el mismo protocolo puede comportarse de forma muy diferente cuando cambian los datos locales y la estrategia adversaria.

Usar una matriz de medición

Un informe compacto puede combinar estos ejes:

EjeQué registrarPor qué importa
Calidad predictivaF1, precision, recall y matriz de confusiónMuestra el efecto en la tarea
Colaboracióntiempo de ronda, entrega de mensajes y participaciónExpone la salud del protocolo
RecursosCPU, memoria y proxy de energíaComprueba la viabilidad
Robustezpoisoning, manipulación de contexto y vecinos retrasadosPrueba las hipótesis de amenaza
Equidadrendimiento por cliente o por claseDetecta fallos locales ocultos

La última fila es especialmente importante en entornos heterogéneos. Un F1 global puede permanecer estable mientras un cliente o una clase minoritaria pierde casi todo su recall. La robustez debería incluir la distribución de resultados, no solo la media.

Interpretar sin exagerar

Tres preguntas hacen más honesta una evaluación:

  1. ¿Qué se mantuvo fijo? Conjunto de datos, modelo, grafo, número de clientes y presupuesto de ataque afectan al resultado.
  2. ¿Qué cambió? Una comparación solo tiene sentido si defensa y línea base comparten condiciones de entrenamiento y comunicación.
  3. ¿Qué falta todavía? Una simulación no establece el comportamiento con sensores, movilidad y fallos reales, ni ante un ataque desconocido.

Por tanto, el estudio Flighter se entiende mejor como una demostración controlada de evaluación entre capas. Conecta rendimiento del modelo y señales situacionales, y ofrece una forma concreta de hablar de influencia reducida, límites de conexión y recuperación. El siguiente paso no es publicar un porcentaje mayor, sino comprobar si los indicadores siguen siendo útiles cuando también son ruidosos, llegan tarde o han sido manipulados.

Protocolo de experimento reutilizable

Para una nueva defensa DFL conviene publicar:

  • la línea base limpia,
  • el grafo y la política de participación,
  • el modelo de ataque y perturbación,
  • métricas predictivas y de sistema por condición,
  • intervalos de confianza o repeticiones,
  • la sobrecarga de recursos de la defensa,
  • el comportamiento de fallo y recuperación.

Ese nivel de detalle convierte robustez, de adjetivo de marketing, en una propiedad auditable del sistema.

Esta nota es una interpretación original de la evaluación adversaria de la tesis doctoral. Los porcentajes se refieren a las condiciones controladas de ese estudio y no deben generalizarse fuera de ellas.

Investigación relacionada

De la monitorización a la mitigación: ciclo de ciberdefensa DFL con explicaciones mediante LLMs

30 de mayo de 2026

De la monitorización a la mitigación: ciclo de ciberdefensa DFL con explicaciones mediante LLMs

Nota práctica sobre cómo monitorización distribuida, modelos DFL, evidencia de alertas y apoyo basado en LLMs pueden encajar en un flujo de ciberdefensa.

Situational awareness para ciberdefensa con aprendizaje federado descentralizado

29 de mayo de 2026

Situational awareness para ciberdefensa con aprendizaje federado descentralizado

Nota de investigación sobre el uso de DFL para convertir telemetría distribuida, anomalías y señales de confianza en situational awareness de ciberdefensa.