Artículo de revista2026

Information Fusion

Decentralized Federated Learning with Multimodal Prototypes for Heterogeneous Data

Modalis aborda clientes con modalidades diferentes o ausentes en aprendizaje descentralizado. Intercambia prototipos compactos de clase y alinea representaciones locales para colaborar con datos heterogéneos.

Aprendizaje federado descentralizadoMultimodal DataHeterogeneous DataNon-IID DataIncomplete DataPrototype-Centric CommunicationMulti-Objective LossContextual Null EmbeddingsMultimodal FusionConvergence Analysis
Scientific overview

Modalis: Multimodal Node-to-node Prototype Learning

Live / Tick 0
Modalis Multimodal Decentralized learning loopVisualizes client nodes extracting embeddings, constructing class prototypes, exchanging them asynchronously between nodes, and using adaptive modality weighting with multimodal fusion.Latent SpaceClient AIATClient BIATClient CIAT
Modalis lens / Step 1 of 6

Heterogeneous Clients

Clients possess non-IID local class distributions and incomplete modalities (some have only image & audio, others text & audio, etc.).

Optimization Losses

Federated Alignment LossL_FAL
Discriminative Contrastive LossL_DCL
Modality Coherence LossL_MCL
Prototype RegularizationL_PR

Key Empirical Results

F1 Score GainRelative gain over the next-best competing method under high heterogeneity.
+4.0%
Communication SavingsReported reduction by sharing compact class prototypes instead of full model parameters.
>40x
Missing ModalitiesEvaluated setting where 50% of modalities may be missing.
pm=0.5
  1. 01

    Heterogeneous Clients

  2. 02

    Local Encoding & Imputation

  3. 03

    Prototype Construction

  4. 04

    Node-to-node Prototype Exchange

  5. 05

    Knowledge Fusion & Loss

  6. 06

    Local Model Update

Resumen científicoRQ3 · RQ4

Completa la progresión técnica hacia DFL multimodal heterogéneo: los clientes intercambian prototipos compactos conscientes de la modalidad en lugar de parámetros completos del modelo, conectando gestión de modalidades ausentes, alineación de representaciones, ponderación de modalidades y eficiencia de las comunicaciones.

Ver animación

+4.0%

mejora relativa de F1

Alta heterogeneidad frente al siguiente mejor método

82.1%

F1 solo imagen

Clientes unimodales en AVMNIST

0.11 MB

carga por cliente

Tamaño medio de mensaje por ronda

>40x

reducción de coste

Frente a métodos de referencia basados en modelos completos

Contribuciones científicas clave

  1. 01DFL multimodal descentralizado:Estudia la colaboración descentralizada cuando los clientes tienen distribuciones de clase non-IID y disponibilidad incompleta de modalidades.
  2. 02Protocolo centrado en prototipos:Intercambia prototipos compactos de clase conscientes de la modalidad en lugar de parámetros completos o actualizaciones completas del modelo.
  3. 03Robustez ante modalidades ausentes:Combina incrustaciones nulas contextuales, ponderación adaptativa de modalidades, fusión multimodal y objetivos de alineación de representaciones.

Conclusiones principales

  1. 01El intercambio de prototipos reportó aproximadamente 0.11 MB por mensaje de cliente, más de 40x menos que métodos de referencia intensivos en comunicación basados en intercambio de modelos completos.
  2. 02Los mecanismos evaluados apoyan la colaboración bajo modalidades ausentes, datos non-IID y configuraciones heterogéneas controladas.
  3. 03Las conclusiones permanecen vinculadas a los conjuntos de datos, configuraciones de modalidad, métodos de referencia y supuestos experimentales documentados.

Resultados empíricos (AVMNIST)

FedAvg

F1 score

69.5%

Coste uplink / ronda

~4.75 MB

FedProto

F1 score

74.8%

Coste uplink / ronda

~0.03 MB

Modalis

F1 score

83.4%

Coste uplink / ronda

~0.11 MB

Fases metodológicas

01

Codificar

Embeddings multimodales locales e incrustaciones nulas contextuales

02

Prototipar

Prototipos compactos de clase intercambiados entre vecinos

03

Fusionar

Ponderación adaptativa de modalidades y alineación de representaciones

Resumen

Decentralized Federated Learning (DFL) enables collaborative machine learning across numerous devices while avoiding bottlenecks and reliance on a single trusted entity inherent to centralized architectures. However, its practical application is challenged by modern scenarios where data is increasingly multimodal. The key obstacles in such settings are severe data heterogeneity, characterized by non-Independent and Identically Distributed (non-IID) class distributions, and incomplete data, where modalities are often missing across clients. Existing solutions struggle with these challenges, either incurring high communication costs or lacking effective mechanisms for fusing partial information. To overcome these limitations, this work introduces Modalis, a novel framework for multimodal DFL that achieves superior model performance under data heterogeneity while minimizing network consumption. It pioneers a communication-efficient, prototype-centric protocol in which clients exchange compact, modality-aware class representations rather than high-dimensional model parameters. This process is guided by a multi-objective loss function enforcing inter-modality coherence and representation alignment for effective knowledge fusion. The framework integrates sophisticated architectural innovations, including contextual null embeddings for intelligent data imputation and robust multimodal fusion using adaptive gating and multi-way transformers. The approach is validated through theoretical analysis, providing formal convergence guarantees, and extensive experiments on standard multimodal benchmarks. These results demonstrate that Modalis achieves superior performance, improving F1 scores by up to 4% under high heterogeneity and reducing communication costs by over 40 times compared to state-of-the-art baselines, establishing it as a highly effective solution for collaborative AI.

Autores

Enrique Tomás Martínez BeltránGérôme BovetGregorio Martínez PérezAlberto Huertas Celdrán

Palabras clave

Aprendizaje federado descentralizadoMultimodal DataHeterogeneous DataNon-IID DataIncomplete DataPrototype-Centric CommunicationMulti-Objective LossContextual Null EmbeddingsMultimodal FusionConvergence Analysis

Publicaciones relacionadas

Publicaciones relacionadas por tema, método o aplicación.

Artículo de revista2024

Expert Systems with Applications

Fedstellar: A Platform for Decentralized Federated Learning

Enrique Tomás Martínez Beltrán, Ángel Luis Perales Gómez, Chao Feng, Pedro Miguel Sánchez Sánchez, Sergio López Bernal, Gérôme Bovet, Manuel Gil Pérez, Gregorio Martínez Pérez, Alberto Huertas Celdrán

In 2016, Google proposed Federated Learning (FL) as a novel paradigm to train Machine Learning (ML) models across the participants of a federation while preserving data privacy. Since its birth, Centralized FL (CFL) h...

Artículo de revista2026

Computer Networks

Asynchronous Cache-based Aggregation with Fairness and Filtering for Decentralized Federated Learning

Enrique Tomás Martínez Beltrán, Eduard Gash, Gérôme Bovet, Alberto Huertas Celdrán, Burkhard Stiller

CAFF aborda los retrasos y la participación desigual en DFL asíncrono. Una caché con una posición por vecino, un filtro de antigüedad y un umbral adaptable equilibran eficiencia de entrenamiento y calidad predictiva.

Artículo de revista2026

Future Generation Computer Systems

FedEnD: Communication-efficient Federated Learning for non-IID data via decentralized ensemble distillation

Enrique Tomás Martínez Beltrán, Philip Giryes, Gérôme Bovet, Burkhard Stiller, Gregorio Martínez Pérez, Alberto Huertas Celdrán

FedEnD aborda la heterogeneidad de datos y el coste de comunicación del aprendizaje federado. Los clientes entrenan especialistas locales, los intercambian una vez y destilan un ensemble ponderado con sus propios datos, sin un conjunto público auxiliar.

Investigación relacionada