Saltar al contenido
Enrique Tomás Martínez Beltrán
InicioInvestigaciónPublicacionesTemasDocenciaBlog
Contacto
EN/ES
InicioInvestigaciónPublicacionesTemasDocenciaBlogContacto
EN/ES

Enrique Tomás Martínez Beltrán

Investigación postdoctoral en IA, ciberseguridad y aprendizaje federado, con trabajo en análisis de amenazas, ciberdefensa de ciclo cerrado y aprendizaje descentralizado confiable.

  • Política de privacidad
  • Términos del servicio
  • Accesibilidad
  • Google Scholarse abre en una pestaña nueva
  • ORCIDse abre en una pestaña nueva
  • LinkedInse abre en una pestaña nueva
  • GitHubse abre en una pestaña nueva
Todos los perfiles
  • ResearchGatese abre en una pestaña nueva
  • Scopusse abre en una pestaña nueva
  • DBLPse abre en una pestaña nueva
  • Web of Sciencese abre en una pestaña nueva

Enrique Tomás Martínez Beltrán. Todos los derechos reservados.

Volver arriba

Este sitio carga analítica opcional de Google y proveedores externos de analítica solo si aceptas. Puedes rechazarla y seguir usando la web con normalidad.

  1. Inicio
  2. Notas de investigación sobre aprendizaje federado, ciberseguridad y ciberdefensa
  3. Cuando los clientes federados ven modalidades diferentes
Multimodal LearningNon-IID DataMissing ModalitiesAprendizaje federado descentralizadoRepresentation Learning

Cuando los clientes federados ven modalidades diferentes

Introducción práctica a datos non-IID, sensores ausentes y vistas parciales

Enrique Tomás Martínez Beltrán

Investigador postdoctoral en Informática

10 de agosto de 20268 min de lectura
  • LinkedInse abre en una pestaña nueva
  • Xse abre en una pestaña nueva
Cuando los clientes federados ven modalidades diferentes

El aprendizaje federado suele asumir que los clientes resuelven la misma tarea con entradas comparables. Esa hipótesis se vuelve frágil cuando un participante dispone de imágenes, otro de audio y un tercero solo de sensores inerciales. El problema no es únicamente que los conjuntos sean non-IID. También son distintas las modalidades disponibles.

El escenario aparece en muchas formas: un dispositivo audiovisual con el micrófono averiado, un vehículo con telemetría pero sin cámara o un cliente de monitorización de crisis que recibe texto sin imagen. Un sistema descentralizado útil debería seguir aprendiendo cuando las observaciones locales son incompletas, en lugar de tratar a todos los clientes como si tuvieran el mismo conjunto de sensores.

Dos clases de heterogeneidad

La heterogeneidad estadística cambia la distribución de clases o características entre clientes. Puede pensarse mediante un parámetro de concentración β\betaβ: valores menores indican datos locales más sesgados y hacen más difícil reconstruir la distribución global desde un único participante.

La heterogeneidad de modalidad es distinta. Un cliente puede tener todas las entradas, un subconjunto o una modalidad temporalmente indisponible. Si mi,r∈{0,1}m_{i,r}\in\{0,1\}mi,r​∈{0,1} indica si el cliente iii observa la modalidad rrr, su representación puede escribirse como:

hi(x)=Fuse⁡({mi,rhr(xr)}r=1R,  {mi,r}r=1R).h_i(x)=\operatorname{Fuse}\left(\{m_{i,r}h_r(x_r)\}_{r=1}^{R},\;\{m_{i,r}\}_{r=1}^{R}\right).hi​(x)=Fuse({mi,r​hr​(xr​)}r=1R​,{mi,r​}r=1R​).

La máscara es importante. Sin ella, un vector de ceros podría significar una observación real, un sensor ausente o un fallo del preprocesamiento.

Por qué el promedio de modelos completos tiene dificultades

El promedio al estilo FedAvg presupone que las actualizaciones de parámetros son suficientemente comparables para combinarlas. Con clases non-IID y modalidades ausentes, un cliente puede llevar el modelo compartido hacia una representación excelente para su vista local, pero mal alineada con las representaciones de los demás.

El fallo puede quedar oculto por la media global. Un cliente multimodal bien conectado puede dominar la combinación mientras un cliente unimodal recibe un modelo cuyas características internas no encajan con sus entradas. Esto es especialmente problemático cuando ese cliente necesita conocimiento sobre una modalidad que no puede observar localmente.

El intercambio de prototipos como otra abstracción

En vez de enviar todos los parámetros, un cliente puede resumir representaciones específicas de cada clase. Para la clase ccc y la modalidad rrr, un prototipo local puede expresarse como:

pi,c(r)=1∣Di,c(r)∣∑x∈Di,c(r)hr(x),p_{i,c}^{(r)} = \frac{1}{|D_{i,c}^{(r)}|} \sum_{x\in D_{i,c}^{(r)}} h_r(x),pi,c(r)​=∣Di,c(r)​∣1​x∈Di,c(r)​∑​hr​(x),

siempre que el conjunto local no esté vacío. Los vecinos pueden alinear prototipos, transferir información entre modalidades disponibles y ausentes y mantener los ejemplos privados en local. Esto no resuelve por sí solo todos los problemas de privacidad, pero proporciona al protocolo un objeto semántico y compacto que intercambiar.

El diseño de la evaluación

El estudio Modalis evalúa este problema con AVMNIST, CREMA-D, UCI-HAR y CRISIS-MMD. Los conjuntos cubren dígitos audiovisuales, emoción audiovisual, reconocimiento de actividad mediante sensores inerciales y eventos de crisis con imagen y texto. El sesgo de clases se controla con β∈{1.0,0.5,0.1}\beta\in\{1.0,0.5,0.1\}β∈{1.0,0.5,0.1} y las configuraciones de modalidad ausente con pm∈{0.0,0.25,0.5}p_m\in\{0.0,0.25,0.5\}pm​∈{0.0,0.25,0.5}.

Los experimentos principales usan 20 clientes conectados mediante un grafo estático de Erdős-Rényi con pER=0.9p_{ER}=0.9pER​=0.9. Este detalle importa: los resultados describen un grafo controlado y no prueban que todas las topologías se comporten igual.

La pregunta central no es si un modelo multimodal puede superar a uno unimodal en un benchmark centralizado. Es si clientes descentralizados con vistas distintas pueden beneficiarse de sus representaciones sin necesitar un servicio central de fusión.

Qué necesita un protocolo multimodal robusto

Un protocolo práctico debería incluir:

  • una máscara o representación explícita para modalidades no disponibles,
  • una regla de fusión capaz de cambiar el peso de cada modalidad presente,
  • un objetivo de alineación que mantenga compatibles las representaciones locales e intercambiadas,
  • un mecanismo alternativo cuando un prototipo está desactualizado o ausente,
  • evaluación por configuración de modalidades, no solo una cifra global.

También debe informar de la sobrecarga de esta maquinaria. La robustez multimodal tiene un coste y un método que obliga a cada cliente a intercambiar un modelo completo puede ser inviable en un enlace limitado.

La lección de investigación

DFL multimodal y heterogéneo es un problema de coordinación entre vistas parciales. El objetivo no es fingir que todos los participantes ven el mismo mundo, sino explicitar las diferencias, resumir el conocimiento útil en una representación controlada y permitir que cada cliente aproveche información que no tiene localmente.

Esta perspectiva conecta aprendizaje non-IID, sensores ausentes y eficiencia de comunicación. También abre una ruta clara para trabajos posteriores: disponibilidad dinámica de modalidades, cambios reales de topología, transferencia entre conjuntos y análisis formal de lo que puede revelar un prototipo.

Esta nota es una síntesis original del problema multimodal y heterogéneo estudiado en la tesis doctoral. No reproduce el artículo de origen.

Investigación relacionada

Modalis: intercambio de prototipos para DFL multimodal heterogéneo

11 de agosto de 2026

Modalis: intercambio de prototipos para DFL multimodal heterogéneo

Recorrido técnico original por el enfoque Modalis basado en prototipos para aprendizaje descentralizado con clases non-IID y modalidades ausentes.

De la revisión al prototipo: un flujo de investigación para DFL

5 de agosto de 2026

De la revisión al prototipo: un flujo de investigación para DFL

Nota metodológica que conecta las contribuciones de revisión, Flighter y Modalis en un flujo reproducible para DFL.