We propose a generative multitimbral DDSP framework focusing on acoustic instruments modeling. Traditional DDSP architectures rely on frame-wise latent encoding, limiting semantic interpretability; the acoustic realm is further challenged by the inherently interdependency of musical descriptors. Our approach introduces disentangled global embeddings for timbre and dynamics, achieved via a Triple-VAE architecture, and a DDSP model to learn temporal dependencies from such reduced representation along with normalized envelope curves. Experimental results demonstrate optimal reconstruction accuracy while enabling flexible and realistic generation capabilities, with the disentangled representation promoting interpretable control over musical descriptors.

Improving Interpretability in Generative Multitimbral DDSP Frameworks via Semantically-Disentangled Musical Attributes / Dal Rì, F., Conci, N.. - (2026), pp. 2641-2645. (ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing Barcelona, Spain 3-8 May 2026) [10.1109/icassp55912.2026.11463192].

Improving Interpretability in Generative Multitimbral DDSP Frameworks via Semantically-Disentangled Musical Attributes

Francesco Ardan Dal Rì;Nicola Conci
2026-01-01

Abstract

We propose a generative multitimbral DDSP framework focusing on acoustic instruments modeling. Traditional DDSP architectures rely on frame-wise latent encoding, limiting semantic interpretability; the acoustic realm is further challenged by the inherently interdependency of musical descriptors. Our approach introduces disentangled global embeddings for timbre and dynamics, achieved via a Triple-VAE architecture, and a DDSP model to learn temporal dependencies from such reduced representation along with normalized envelope curves. Experimental results demonstrate optimal reconstruction accuracy while enabling flexible and realistic generation capabilities, with the disentangled representation promoting interpretable control over musical descriptors.
2026
ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)
Piscataway, New Jersey, USA
Institute of Electrical and Electronics Engineers (IEEE)
979-8-3315-6701-9
Dal Rì, Francesco; Conci, Nicola
Improving Interpretability in Generative Multitimbral DDSP Frameworks via Semantically-Disentangled Musical Attributes / Dal Rì, F., Conci, N.. - (2026), pp. 2641-2645. (ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing Barcelona, Spain 3-8 May 2026) [10.1109/icassp55912.2026.11463192].
File in questo prodotto:
File Dimensione Formato  
ICASSP_DDSP_CAMERA_READY-3-2.pdf

accesso aperto

Tipologia: Post-print referato (Refereed author’s manuscript)
Licenza: Tutti i diritti riservati (All rights reserved)
Dimensione 4.59 MB
Formato Adobe PDF
4.59 MB Adobe PDF Visualizza/Apri
Improving_Interpretability_in_Generative_Multitimbral_DDSP_Frameworks_via_Semantically-Disentangled_Musical_Attributes.pdf

Solo gestori archivio

Tipologia: Versione editoriale (Publisher’s layout)
Licenza: Tutti i diritti riservati (All rights reserved)
Dimensione 6.08 MB
Formato Adobe PDF
6.08 MB Adobe PDF   Visualizza/Apri

I documenti in IRIS sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/11572/496433
Citazioni
  • ???jsp.display-item.citation.pmc??? ND
  • Scopus ND
  • ???jsp.display-item.citation.isi??? ND
  • OpenAlex 0
social impact