dorsal/arxiv
View SchemaDaQ-MSA: Denoising and Qualifying Diffusion Augmentations for Multimodal Sentiment Analysis
| Authors | Jiazhang Liang, Jianheng Dai, Miaosen Luo, Menghua Jiang, Sijie Mai |
|---|---|
| Categories | |
| ArXiv ID | 2601.06870vv1 |
| URL | https://arxiv.org/abs/2601.06870 |
| License | http://arxiv.org/licenses/nonexclusive-distrib/1.0/ |
Abstract
Multimodal large language models (MLLMs) have demonstrated strong performance on vision-language tasks, yet their effectiveness on multimodal sentiment analysis remains constrained by the scarcity of high-quality training data, which limits accurate multimodal understanding and generalization. To alleviate this bottleneck, we leverage diffusion models to perform semantics-preserving augmentation on the video and audio modalities, expanding the multimodal training distribution. However, increasing data quantity alone is insufficient, as diffusion-generated samples exhibit substantial quality variation and noisy augmentations may degrade performance. We therefore propose DaQ-MSA (Denoising and Qualifying Diffusion Augmentations for Multimodal Sentiment Analysis), which introduces a quality scoring module to evaluate the reliability of augmented samples and assign adaptive training weights. By down-weighting low-quality samples and emphasizing high-fidelity ones, DaQ-MSA enables more stable learning. By integrating the generative capability of diffusion models with the semantic understanding of MLLMs, our approach provides a robust and generalizable automated augmentation strategy for training MLLMs without any human annotation or additional supervision.
{
"annotation_id": "b86dc468-2783-4dff-a2a6-740db33b3c9b",
"date_created": "2026-02-17T05:53:08.663000Z",
"date_modified": "2026-02-17T05:53:08.663000Z",
"file_hash": "3467ec79318bc8a2f60c9fb9129df53a6e349b3871d3e8df7f6eb164a73ca186",
"private": false,
"record": {
"abstract": "Multimodal large language models (MLLMs) have demonstrated strong performance on vision-language tasks, yet their effectiveness on multimodal sentiment analysis remains constrained by the scarcity of high-quality training data, which limits accurate multimodal understanding and generalization. To alleviate this bottleneck, we leverage diffusion models to perform semantics-preserving augmentation on the video and audio modalities, expanding the multimodal training distribution. However, increasing data quantity alone is insufficient, as diffusion-generated samples exhibit substantial quality variation and noisy augmentations may degrade performance. We therefore propose DaQ-MSA (Denoising and Qualifying Diffusion Augmentations for Multimodal Sentiment Analysis), which introduces a quality scoring module to evaluate the reliability of augmented samples and assign adaptive training weights. By down-weighting low-quality samples and emphasizing high-fidelity ones, DaQ-MSA enables more stable learning. By integrating the generative capability of diffusion models with the semantic understanding of MLLMs, our approach provides a robust and generalizable automated augmentation strategy for training MLLMs without any human annotation or additional supervision.",
"arxiv_id": "2601.06870",
"authors": [
"Jiazhang Liang",
"Jianheng Dai",
"Miaosen Luo",
"Menghua Jiang",
"Sijie Mai"
],
"categories": [
"cs.LG",
"cs.AI"
],
"license": "http://arxiv.org/licenses/nonexclusive-distrib/1.0/",
"title": "DaQ-MSA: Denoising and Qualifying Diffusion Augmentations for Multimodal Sentiment Analysis",
"url": "https://arxiv.org/abs/2601.06870",
"version": "v1"
},
"schema_id": "dorsal/arxiv",
"source": {
"execution_id": "3f3df872-c716-4d3a-bd84-3f1cb2c67586",
"id": "arXiv Dataset",
"type": "Model",
"variant": "snapshot-2026-01-17",
"version": "0.1.0"
},
"user_id": 1000002
}