
@Article{cmc.2026.085768,
AUTHOR = {Weiwei Li, Li Zhao, Chengshan Li, Wenjie Geng},
TITLE = {DDGEM: Diffusion Denoising and Generative Enhancement for Multimodal Recommendation},
JOURNAL = {Computers, Materials \& Continua},
VOLUME = {89},
YEAR = {2026},
NUMBER = {2},
PAGES = {--},
URL = {http://www.techscience.com/cmc/v89n2/68802},
ISSN = {1546-2226},
ABSTRACT = {In multimodal recommendation, sparse implicit feedback can lead to noisy collaborative graphs, while long-tail and cold-start items often lack reliable collaborative signals. Textual and visual features provide useful item-side information, but they may also be incomplete or inconsistent across modalities. These issues make robust user and item representation learning difficult. To address them, we propose Diffusion Denoising and Generative Enhancement for Multimodal Recommendation (DDGEM). DDGEM first applies node-wise diffusion denoising in the latent collaborative space to reduce unreliable user–item signals. It then uses relational diffusion to reconstruct adaptive item–item relations instead of relying on fixed semantic similarity. For sparse and cold-start items, a conditional variational autoencoder (CVAE)-based conditional generative module produces complementary item representations from textual and visual features, followed by popularity-aware generation balance. Finally, behavior-aware multimodal fusion dynamically combines collaborative, textual, and visual representations for each user–item pair. Experiments on three public Amazon datasets show that DDGEM outperforms representative collaborative filtering, generative recommendation, and multimodal recommendation baselines. Further significance tests, ablation studies, efficiency comparison, graph-noise robustness analysis, strict cold-start evaluation, modality-conflict analysis, and hyperparameter analysis verify the effectiveness and practical behavior of DDGEM.},
DOI = {10.32604/cmc.2026.085768}
}



