El aprendizaje federado suele asumir que los clientes resuelven la misma tarea con entradas comparables. Esa hipótesis se vuelve frágil cuando un participante dispone de imágenes, otro de audio y un tercero solo de sensores inerciales. El problema no es únicamente que los conjuntos sean non-IID. También son distintas las modalidades disponibles.
El escenario aparece en muchas formas: un dispositivo audiovisual con el micrófono averiado, un vehículo con telemetría pero sin cámara o un cliente de monitorización de crisis que recibe texto sin imagen. Un sistema descentralizado útil debería seguir aprendiendo cuando las observaciones locales son incompletas, en lugar de tratar a todos los clientes como si tuvieran el mismo conjunto de sensores.
Dos clases de heterogeneidad
La heterogeneidad estadística cambia la distribución de clases o características entre clientes. Puede pensarse mediante un parámetro de concentración : valores menores indican datos locales más sesgados y hacen más difícil reconstruir la distribución global desde un único participante.
La heterogeneidad de modalidad es distinta. Un cliente puede tener todas las entradas, un subconjunto o una modalidad temporalmente indisponible. Si indica si el cliente observa la modalidad , su representación puede escribirse como:
La máscara es importante. Sin ella, un vector de ceros podría significar una observación real, un sensor ausente o un fallo del preprocesamiento.
Por qué el promedio de modelos completos tiene dificultades
El promedio al estilo FedAvg presupone que las actualizaciones de parámetros son suficientemente comparables para combinarlas. Con clases non-IID y modalidades ausentes, un cliente puede llevar el modelo compartido hacia una representación excelente para su vista local, pero mal alineada con las representaciones de los demás.
El fallo puede quedar oculto por la media global. Un cliente multimodal bien conectado puede dominar la combinación mientras un cliente unimodal recibe un modelo cuyas características internas no encajan con sus entradas. Esto es especialmente problemático cuando ese cliente necesita conocimiento sobre una modalidad que no puede observar localmente.
El intercambio de prototipos como otra abstracción
En vez de enviar todos los parámetros, un cliente puede resumir representaciones específicas de cada clase. Para la clase y la modalidad , un prototipo local puede expresarse como:
siempre que el conjunto local no esté vacío. Los vecinos pueden alinear prototipos, transferir información entre modalidades disponibles y ausentes y mantener los ejemplos privados en local. Esto no resuelve por sí solo todos los problemas de privacidad, pero proporciona al protocolo un objeto semántico y compacto que intercambiar.
El diseño de la evaluación
El estudio Modalis evalúa este problema con AVMNIST, CREMA-D, UCI-HAR y CRISIS-MMD. Los conjuntos cubren dígitos audiovisuales, emoción audiovisual, reconocimiento de actividad mediante sensores inerciales y eventos de crisis con imagen y texto. El sesgo de clases se controla con y las configuraciones de modalidad ausente con .
Los experimentos principales usan 20 clientes conectados mediante un grafo estático de Erdős-Rényi con . Este detalle importa: los resultados describen un grafo controlado y no prueban que todas las topologías se comporten igual.
La pregunta central no es si un modelo multimodal puede superar a uno unimodal en un benchmark centralizado. Es si clientes descentralizados con vistas distintas pueden beneficiarse de sus representaciones sin necesitar un servicio central de fusión.
Qué necesita un protocolo multimodal robusto
Un protocolo práctico debería incluir:
- una máscara o representación explícita para modalidades no disponibles,
- una regla de fusión capaz de cambiar el peso de cada modalidad presente,
- un objetivo de alineación que mantenga compatibles las representaciones locales e intercambiadas,
- un mecanismo alternativo cuando un prototipo está desactualizado o ausente,
- evaluación por configuración de modalidades, no solo una cifra global.
También debe informar de la sobrecarga de esta maquinaria. La robustez multimodal tiene un coste y un método que obliga a cada cliente a intercambiar un modelo completo puede ser inviable en un enlace limitado.
La lección de investigación
DFL multimodal y heterogéneo es un problema de coordinación entre vistas parciales. El objetivo no es fingir que todos los participantes ven el mismo mundo, sino explicitar las diferencias, resumir el conocimiento útil en una representación controlada y permitir que cada cliente aproveche información que no tiene localmente.
Esta perspectiva conecta aprendizaje non-IID, sensores ausentes y eficiencia de comunicación. También abre una ruta clara para trabajos posteriores: disponibilidad dinámica de modalidades, cambios reales de topología, transferencia entre conjuntos y análisis formal de lo que puede revelar un prototipo.
Esta nota es una síntesis original del problema multimodal y heterogéneo estudiado en la tesis doctoral. No reproduce el artículo de origen.


