| Paper Title | Authors |
| Off-Manifold Robustness in Synthesizer Inversion with Joint Distribution Flow Matching | Ben Hayes (Sony Computer Science Laboratories Paris) |
| FusID: Modality-Fused Semantic IDs for Generative Music Recommendation | Haven Kim (University of California San Diego); Yupeng Hou (University of California San Diego); Julian McAuley (University of California San Diego) |
| Dual-Time Representation Framework for Interactive Music Transcription | Yu Sugimoto (Kyushu University); Ryo Nishikimi (NTT Communication Science Laboratories); Eita Nakamura (Kyushu University) |
| TUTTI: Toward generalizable audio-to-score transcription via fully synthesized data | Jianhuai Hu (Central Conservatory of Music); Yashan Wang (Central Conservatory of Music); Shangda Wu (Independent Researcher); Zhancheng Guo (Central Conservatory of Music); Shijie Liang (Central Conservatory of Music); Wuna Meng (Wuhan Conservatory of Music); Chuanqi Yang (Shanghai Conservatory of Music); Xiaobing Li (Central Conservatory of Music); Feng Yu (Central Conservatory of Music); Maosong Sun (TsingHua University) |
| Streaming Generation for Music Accompaniment | Yusong Wu (University of Montreal, Mila); Mason Wang (MIT); Heidi Lei (MIT); Stephen Brade (MIT); Lancelot Blanchard (MIT); Shih-Lun Wu (MIT); Aaron Courville (University of Montreal, Mila); Anna Huang (MIT) |
| Learning to Sing with Your Own Voice: Designing and Evaluating Generative AI-Assisted Vocal Coaching | Tianyu Gao (National University of Singapore); Shuqi Dai (Carnegie Mellon University); Roger B. Dannenberg (Carnegie Mellon University); Zhiyong Huang (National University of Singapore); Jin Song Dong (National University of Singapore); Jocelyn Dueck (Carnegie Mellon University) |
| Pitch Estimation and Vocal Melody Extraction with Self-supervised Phase Comparators | Li Su (Academia Sinica) |
| MuScriptor: An Open Model for Multi-Instrument Music Transcription | Simon Rouard (Kyutai); Michael Krause (Mirelo AI); Axel Roebel (IRCAM); Carl-Johann Simon-Gabriel (Mirelo AI); Alexandre Défossez (Kyutai) |
| Pitch Shifting via Semantic Transformations in a Shared Audio-Symbolic Latent Space | Ben Maman (International Audio Laboratories Erlangen); Andreas Brendel (Fraunhofer IIS Erlangen); Meinard Müller (International Audio Laboratories Erlangen) |
| Multi-Task Multi-Frame Visual Piano Transcription | Yonghyun Kim (Georgia Institute of Technology); Hoyeol Sohn (KAIST); Juhan Nam (KAIST); Alexander Lerch (Georgia Institute of Technology) |
| Investigating Ethiopian Kiñit in Secular Music: A Self-Supervised Learning and Computational Analysis | Berihu Yohannes Tesfay (Institute of Information Science, Academia Sinica; National Tsing Hua University; Mekelle University); Cheng-Hsin Hsu (National Tsing Hua University); Samuel Redie Fishatsion (Arts Academy, Mekelle University); Li Su (Institute of Information Science, Academia Sinica) |
| Towards Robust Version Identification in the Wild: A Dataset, Benchmark, and Fine-Tuning Study | Simon Hachmeier (Humboldt-Universität zu Berlin); R. Oguz Araz (Universitat Pompeu Fabra); Dmitry Bogdanov (Universitat Pompeu Fabra); Robert Jäschke (Humboldt-Universität zu Berlin); Xavier Serra (Universitat Pompeu Fabra) |
| CrowdioSet and PaRIRset: Two Datasets Towards Live Music Source Separation | Enric Gusó (Universitat Pompeu Fabra); Xavier Serra (Universitat Pompeu Fabra) |
| Prima la Musica! Musically-Informed Symbolic Features for Section Boundary Detection in MIDI | ELVIO CIPOLLONE (Centre Culturel Buqi); FRANCESCO CIPOLLONE (Centre Culturel Buqi) |
| A Dataset and Benchmark for Optical Music Recognition of String Quartet Scores | DongMin Kim (Sogang University); Brian Liu (Independent Researcher); Jose J. Valero-Mas (University of Alicante); Dasaem Jeong (Sogang University) |
| The Debussy Dataset: Evaluating Optical Music Recognition on Modern Staff Notation Manuscripts | Hugo Scheithauer (Inria); Thibault Clérice (Inria); Gonzalo Romero-García (EPITA) |
| VIOLET: High-Fidelity Violin Synthesis with Techniques and Dynamics | Baotong Tian (University of Rochester); Cynthia Lu (University of Rochester); Vincent K.M. Cheung (Sony Computer Science Laboratories); Ting-Kang Wang (National Taiwan University); Jonathan Churchill (Embertone); Zhiyao Duan (University of Rochester) |
| DDSynth-RL: Audio Synthesizer Inversion via Discrete Diffusion with Reinforcement Learning | Tristan WU (Computational Media and Art, The Hong Kong University of Science and Technology (Guangzhou)); Daniel Chin (New York University Shanghai); Junan Zhang (The Chinese University of Hong Kong, Shenzhen); Junyan Jiang (New York University Shanghai); Yansen Jing (Department of Automation, Tsinghua University); Gus Xia (Mohamed bin Zayed University of Artificial Intelligence) |
| H2H Music Improv: A Communication Model and Audio-Visual Dataset for Music Improvisation | Aleksandra Teng Ma (Georgia Institute of Technology); Anthony Cammarota (Georgia Institute of Technology); Jiayi Wang (Georgia Institute of Technology); Alexandria Smith (Georgia Institute of Technology); Cheng-Zhi Anna Huang (Massachusetts Institute of Technology); Jeffrey Albert (Georgia Institute of Technology); Alexander Lerch (Georgia Institute of Technology) |
| CODA: Cascaded Online Discontinuity-Aware Alignment for Real-Time Image-Based Score Following | Yining Yang (Western University); Ruogu Chen (University of Alberta); Jie Han (University of Alberta) |
| Low-Latency Real-Time Automatic Music Transcription with Band-Split RNN and Temporal Lookahead | Yuta Kusaka (Yamaha Corporation); Akira Maezawa (Yamaha Corporation) |
| StemFX: Learning Mixing Style Representations via Autoregressive FX Chain Prediction on Source-Separated Stems | Yuan-Chiao Cheng (Independent Researcher); Jui-Te Wu (Independent Researcher); Brian Chen (Independent Researcher); Yen-Tung Yeh (National Taiwan University); Yu-Hua Chen (National Taiwan University); Yi-Hsuan Yang (National Taiwan University) |
| Improved Robustness in AI-Generated Music Detection | Emile Dugelay (Centrale Lyon); Thomas Barand (Centrale Lyon); Aurélien Laouar (Centrale Lyon); Baptiste Campeas (Centrale Lyon); Darius Afchar (Deezer Research); Romain Hennequin (Deezer Research) |
| Toward Song Exploration Without Listening Through Lyrics-Derived Linguistic Information | Kanako Suzuki (Waseda University); Kosetsu Tsukuda (National Institute of Advanced Industrial Science and Technology (AIST)); Takayuki Nakatsuka (National Institute of Advanced Industrial Science and Technology (AIST)); Kento Watanabe (National Institute of Advanced Industrial Science and Technology (AIST)); Tomoyasu Nakano (National Institute of Advanced Industrial Science and Technology (AIST)); Masataka Goto (National Institute of Advanced Industrial Science and Technology (AIST)); Keitaro Tanaka (Waseda Research Institute for Science and Engineering); Shigeo Morishima (Waseda Research Institute for Science and Engineering) |
| Masked Diffusion Enables Coherent Beat Tracking | Francesco Foscarin (Music AI); Filip Korzeniowski (Music AI); Richard Vogl (Music AI) |
| FMANet: Efficient and Lightweight Beat Tracking via Fourier Modulation Attention | Ganghui Ru (Fudan University); Yi Yu (Hiroshima University); Wei Li (Fudan university) |
| Analyzing and Reducing the Synthetic-to-Real Transfer Gap in Music Information Retrieval: The Task of Automatic Drum Transcription | Mickaël Zehren (Umeå University); Marco Alunno (Universidad EAFIT Medellín); Paolo Bientinesi (Umeå University) |
| On the Geometry of Music Bandwidth Extension in Latent Spaces of Audio Codecs | Hendrik Vincent Koops (Universal Music Group); Hao Hao Tan (Universal Music Group); Elio Quinton (Universal Music Group) |
| Steering Dense Music Retrieval With Open-Vocabulary Concept Discovery | Julien Guinot (Queen Mary University of London); Alain Riou (Universal Music Group); Elio Quinton (Universal Music Group); György Fazekas (Queen Mary University of London) |
| Estimating the Reliability of Dynamic Time Warping Alignments Using Circumstantial Evidence | Aanya Pratapneni (Harvey Mudd College); Alice Yuan (Harvey Mudd College); TJ Tsai (Harvey Mudd College) |
| Rethinking Automatic Music Mixing as Sequential Stem Blending | Yen-Tung Yeh (National Taiwan University); Chung-Jui Chan (National Taiwan University); Yun-Ning (Amy) Hung (Moises); Yi-Hsuan Yang (National Taiwan University) |
| TART: A Modular Tool For Technique-Aware Audio-To-Tablature Guitar Transcription | Akshaj Gupta (Berkeley AI Research Lab); Hwi Joo Park (UC Berkeley); Andrea Guzman (UC Berkeley); Shamak Gowda (UC Berkeley); Samhita Konduri (UC Berkeley); Jiachen Lian (UC Berkeley); Robin Netzorg (UC Berkeley); Gopala Anumanchipalli (UC Berkeley) |
| Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling | Yishan Lv (Xi'an Jiaotong University); Jing Luo (Xi'an Jiaotong University); Boyuan Ju (Xi'an Jiaotong University); Yang Zhang (Xi'an Jiaotong University); Xinda Wu (Xi'an Jiaotong University); Bo Yuan (Xi'an Jiaotong University); Xinyu Yang (Xi'an Jiaotong University) |
| Exploring the Design Space of Representation Learning for Audio Transformations | Sungho Lee (Seoul National University); Marco A. Martínez-Ramírez (Sony AI); Junghyun Koo (Sony AI); Wei-Hsiang Liao (Sony AI); Kyogu Lee (Seoul National University); Yuki Mitsufuji (Sony AI) |
| PEACE: Joint Embeddings of DSP Effects Code and Audio | David Braun (Princeton University); Adam Finkelstein (Princeton University) |
| Improving Music Source Separation with Diffusion and Consistency Refinement | Tornike Karchkhadze (UC San Diego); Mohammad Rasool Izadi (bose); Shuo Zhang (Bose); Shlomo Dubnov (UC San Diego) |
| UOT-IR: Structured Routing of High-Polyphony Symbolic Music into Fixed-Budget Representations | Ziyue Kang (FIST, Xi'an Jiaotong University;IRC of Frontier Science and Technology, Xi'an Jiaotong University); Nan Nan (FIST, Xi'an Jiaotong University;IRC of Frontier Science and Technology, Xi'an Jiaotong University;MOE KLINNS Lab, Xi'an Jiaotong University); Chenhao Lin (FIST, Xi'an Jiaotong University;IRC of Frontier Science and Technology, Xi'an Jiaotong University;MOE KLINNS Lab, Xi'an Jiaotong University); Xiaohong Guan (Xi'an Jiaotong University; Tsinghua University) |
| On the use of Pre-trained Audio Encoders for Audio-to-Score Music Transcription | Antonio Hidalgo-Centeno (Pattern Recognition and Artificial Intelligence Group, University of Alicante); Carlos Penarrubia (Pattern Recognition and Artificial Intelligence Group, University of Alicante); Jose J. Valero-Mas (Pattern Recognition and Artificial Intelligence Group, University of Alicante) |
| MIDI-LLM: Improving Text-to-MIDI Music Generation via Adapting Large Language Models | Shih-Lun Wu (Massachusetts Institute of Technology); Dave Carlton (Hooktheory); Ryan Miyakawa (Hooktheory); Yoon Kim (Massachusetts Institute of Technology); Chris Donahue (Carnegie Mellon University); Cheng-Zhi Anna Huang (Massachusetts Institute of Technology) |
| Integrating Contextual Embeddings into Evaluation of Expressive MIDI Piano Performances | Dmitrii Gavrilev (Skolkovo Institute of Science and Technology); Ilya Borovik (Skolkovo Institute of Science and Technology); Vladimir Viro (Peachnote) |
| Beat This! Live - Online Beat and Downbeat Tracking by Predicting the Future | Bánk Juhász (Johannes Kepler Universität Linz); Gerhard Widmer (Johannes Kepler Universität Linz); Jan Schlüter (Johannes Kepler Universität Linz) |
| Latent Trace Guidance for Generative Control Without Disentangled Data in Symbolic Melodic Harmonization | Maximos Kaliakatsos-Papakostas (Hellenic Mediterranean University); Dimos Makris (Hellenic Mediterranean University); Konstantinos-Theodoros Tsamis (Hellenic Mediterranean University); Konstantinos Soiledis (Hellenic Mediterranean University); Vassilis Katsouros (Athena Research Centre) |
| LiveBand: Live Accompaniment Generation in the Audio Domain | Marco Pasini (Queen Mary University of London); Javier Nistal (Sony Computer Science Laboratories Paris); Mathias R. Bjare (Johannes Kepler University Linz); Stefan Lattner (Sony Computer Science Laboratories Paris); György Fazekas (Queen Mary University of London) |
| The Internet Archive Music Dataset | Paraskevas Stamatiadis (Telecom Paris); Bernardo V. Miranda (Telecom Paris); Clémentine Berger (Telecom Paris); Gaël Richard (Telecom Paris); Mathieu Fontaine (Telecom Paris); Slim Essid (NVIDIA) |
| Playability-Aware Audio-to-Tablature Guitar Transcription via Diffusion Models | Riccardo Simionato (Universirty of Oslo); Louis Bigo (University of Bordeaux) |
| OudTabs: An Interactive Microtonal Tablature Platform for Cross-Tradition Oud Repertoires | Anıl Tuncel (ETH Zürich) |
| Full-page Recognition of Handwritten Jeongganbo music scores: Dataset and Approach | Carlos Penarrubia (University of Alicante); Danbinaerin Han (KAIST); Dasaem Jeong (Sogang University); Jose J Valero-Mas (University of Alicante) |
| Physiology-Driven Music Retrieval Using Contrastive Learning | Ananth Venkatesh (Kings College London); Elaine Chew (Kings College London) |
| Equivariant Music Transformer | Zixun Guo (Singapore University of Technology and Design); Simon Dixon (Queen Mary University of London) |
| Learning Jazz Pianist Style with Cross-Attention Conditioning | Drew Edwards (QMUL); Akira Maezawa (Yamaha Corporation); Simon Dixon (QMUL) |
| Recovering Affective Signals in Baroque Opera: A Comparative Evaluation of Human and LLM Annotation | Carlos Vaquero Patricio (ICCMU); Álvaro Torrente (ICCMU) |
| Interpretable Inverse Acoustic Modeling of Percussion via Physics-Guided Spectral Decomposition | Rajeev Rajan (Government Engineering College,Idukki, Kerala); Kevin Benty (APJ Abdul Kalam Technological University, India); Athul Joe Joseph Palliparambil (APJ Abdul Kalam Technological University, India) |
| Do Music Generative Models Understand Musical Qualities? Automatic Music Evaluation with Model-Intrinsic Signals | Xiaosha Li (Georgia Institute of Technology); Chun Liu (ByteDance Inc.); Ziyu Wang (New York University) |
| From Prompting to Describing: A Cross-Cultural Study of Language for AI-Generated Music | Sangheon Park (Georgia Institute of Technology); Claire Arthur (Georgia Institute of Technology) |
| Phase-Based Onset Enhancement for Piano Transcription in Ensemble Settings | Hyemi Kim (KAIST / ETRI); Jiyun Park (KAIST); Juhan Nam (KAIST) |
| Online Music Concerts Leveraging Existing Music Videos: A Case Study on a Music Web Service | Kosetsu Tsukuda (National Institute of Advanced Industrial Science and Technology (AIST)); Keisuke Ishida (National Institute of Advanced Industrial Science and Technology (AIST)); Masahiro Hamasaki (National Institute of Advanced Industrial Science and Technology (AIST)); Masataka Goto (National Institute of Advanced Industrial Science and Technology (AIST)) |
| VioLM: A Neural Language Model for Violin Synthesis with Articulation | Sunan Zou (Peking University); Zhe Zhang (National Institute of Informatics); Yigitcan Özer (National Institute of Informatics); Guojie Luo (Peking University); Junichi Yamagishi (National Institute of Informatics) |
| Long, Short, and In Between: Non-Isochronous Models of Timing in Balkan Song Performances | George Sioros (University of Music and Performing Arts Vienna) |
| Genre Bias or Aesthetic Perception? Identifying and Mitigating Shortcut Learning in Music Evaluation | Yizhou Zhang (Kyoto University); Wangjin Zhou (Kyoto University); Yi Zhao (Tencent); Wei Tan (Tencent); Keisuke Imoto (Kyoto University); Zhi Gong (Tencent) |
| End-to-End Motif Discovery for Symbolic Polyphonic Music via Differentiable Label Propagation on Note-Pair Graphs | Raynaldi Lalang (Kyoto University); Kazuyoshi Yoshii (Kyoto University) |
| Gugak-VocalSet: A Multi-Genre Studio-Quality Dataset of Korean Traditional Singing with Sigimsae Annotations | Danbinaerin Han (KAIST); Wonil Kim (Neutune); Seah Hong (National Gugak Center); Dongjoo Moon (Neutune); Jaeok Lee (National Gugak Center); Jongpil Lee (Neutune); Chaewon Kim (National Gugak Center); Juhan Nam (KAIST) |
| Unified Music Identification for Tracks and Versions | R. Oguz Araz (Universitat Pompeu Fabra); Joan Serrà (Sony AI); Yuki Mitsufuji (Sony AI); Xavier Serra (Universitat Pompeu Fabra); Dmitry Bogdanov (Universitat Pompeu Fabra) |
| Do Music Foundation Models Embed Pitch in Helical Structure? | Hayato Yagi (Keio University); Shinnosuke Takamichi (Keio University/ University of Tokyo); Rin Sato (Waseda University); Keitaro Tanaka (Waseda University); Shigeo Morishima (Waseda University) |
| When AI Annotates First: Measuring Its Impact on Music Score Labeling | Alejandro Galan-Cuenca (University Institute for Computing Research, University of Alicante); Juan P. Martinez-Esteso (University Institute for Computing Research, University of Alicante); Carlos Pérez-Sancho (University Institute for Computing Research, University of Alicante); Francisco J. Castellanos (University Institute for Computing Research, University of Alicante); Antonio Javier Gallego (University Institute for Computing Research, University of Alicante) |
| SymphonyGen: 3D Hierarchical Orchestral Generation with Controllable Harmony Skeleton | Xuzheng He (Central Conservatory of Music); Nan Nan (Xi'an Jiaotong University); Zhilin Wang (University of Science and Technology of China); Ziyue Kang (Xi'an Jiaotong University); Zhuoru Mo (Shenzhen University); Ao Li (Xi'an Jiaotong University); Yu Pan (Central Conservatory of Music); Xiaobing Li (Central Conservatory of Music); Feng Yu (Central Conservatory of Music); Xiaohong Guan (Xi'an Jiaotong University) |
| Music Genre Classification Using Audio and Automatically Transcribed Lyrics | Jun-You Wang (National Taiwan Normal University); Hsuan Yu Chen (National Taiwan Normal University) |
| Revisiting Two-Stage Audio Chord Recognition in the Deep-Learning Era: Leveraging Multi-Pitch Estimation and Symbolic Pretraining | Yiwei Ding (University of Würzburg); Yannik Venohr (University of Würzburg); Sebastian Strahl (International Audio Laboratories Erlangen); Meinard Müller (International Audio Laboratories Erlangen); Christof Weiß (University of Würzburg) |
| BARS: Beat-Adaptive Rap Synthesis via Flow Matching | Taemin Cho (BandLab Technologies); Hector Martel (BandLab Technologies); Enyan Koh (BandLab Technologies) |
| MPEcho: A Melody and Phoneme-Aware Generative Framework for Controllable Cover Song Generation | Wei-Jaw Lee (National Taiwan University); Hsuan-Yu Yeh (National Taiwan University); Ting-Yi Hu (National Taiwan University); Chih-Pin Tan (National Taiwan University); Fang-Duo Tsai (National Taiwan University); Yi-Hsuan Yang (National Taiwan University) |
| What Makes a Good Layer? Assessing the Layer-Wise Intrinsic Properties of Music Foundation Models | Angelos-Nikolaos Kanatas (Music Technology Group, Universitat Pompeu Fabra); Yuexuan Kong (Deezer Research); Pablo Alonso-Jiménez (Music Technology Group, Universitat Pompeu Fabra); Xavier Serra (Music Technology Group, Universitat Pompeu Fabra); Dmitry Bogdanov (Music Technology Group, Universitat Pompeu Fabra) |
| Musical Emotion under Cochlear Implant Listening: Human Perception and Foundation Model Representations of Human-Composed and AI-Generated Music | Taein Song (KAIST); Hyunjae Kim (KAIST); Kyung Myun Lee (KAIST) |
| Soft Late-Fusion Alignment and Pattern-Based Performance Analysis of Early 20th-Century Solo Flute Music | Patrice Thibaud (Univ. Lille, CNRS, Inria, Centrale Lille, UMR 9189 CRIStAL, F-59000 Lille, France); Louis Bigo (Univ. Bordeaux, CNRS, Bordeaux INP, LaBRI, UMR 5800, F-33400 Talence); Mathieu Giraud (Univ. Lille, CNRS, Inria, Centrale Lille, UMR 9189 CRIStAL, F-59000 Lille, France); Yann Teytaut (Univ. Lille, CNRS, Inria, Centrale Lille, UMR 9189 CRIStAL, F-59000 Lille, France) |
| Robust Instrument-Agnostic Music Transcription for Western Classical Music | Yannik Venohr (University of Würzburg); Christof Weiß (University of Würzburg) |
| Pianoid: 3D Pianist Body Motion Generation from MIDI | Joonhyung Bae (KAIST); Juhan Nam (KAIST) |
| More than words: Genre-Discriminating Lyrical Patterns in Anglophone German Popular Music | Markus Radke (Technische Universität Berlin); Steffen Lepa (Technische Universität Berlin) |
| MEX: The Musical Expectation Benchmark Suite | Mathias Rose Bjare (Johannes Kepler University Linz); Augustin Bouquillard (Max Planck Institute for Empirical Aesthetics); Giorgia Cantisani (Sciences et Technologies de la Musique et du Son, CNRS, IRCAM, Sorbonne Université); Seung-Goo Kim (Max Planck Institute for Empirical Aesthetics); Stefan Lattner (Sony Computer Science Laboratories (CSL), Paris); Gerhard Widmer (Johannes Kepler University Linz) |
| SKY-Piano: A Multimodal Piano Performance Dataset | Joonhyung Bae (KAIST); Dawon Park (Seoul National University); Taegyun Kwon (KAIST); Yoon-Seok Choi (Seoul National University); Hyeon Hur (Seoul National University); Satoshi Obata (YAMAHA); Shigeru Kai (YAMAHA); Yohei Wada (YAMAHA); Yu Takahashi (YAMAHA); Akira Maezawa (YAMAHA); Jaebum Park (Seoul National University); Jonghwa Park (Seoul National University); Juhan Nam (KAIST) |
| CapCyCin: Improving Music Captioning through Cycle-Consistent Music–Text Alignment | Saeyeon Hwang (Department of Data Science, Graduate School of Data Science, Seoul National University); Kyungsu Kim (Department of Intelligence and Information, Graduate School of Convergence Science and Technology, Seoul National University); Kyogu Lee (IPAI, Department of Intelligence and Information, AIIS, Seoul National University) |
| Human Performance in Lyric Topic Classification: Evaluation and Implications | Varvara Papazoglou (University of Sheffield); Robert Gaizauskas (University of Sheffield); Alexandros Stamatiadis (Independent Researcher) |
| CoALa: A Plugin Model for Controlling Audio Latents | Sarah Nabi (IRCAM); Nabarun Goswami (The University of Tokyo); Philippe Esling (IRCAM); Geoffroy Peeters (Telecom Paris); Frédéric Bevilacqua (IRCAM); Tatsuya Harada (The University of Tokyo) |
| MAJEPPA: Morphing and Assessing in a Unified Piano Performance Space | Jinwen Zhou (Queen Mary University of London); Huan Zhang (Queen Mary University of London); Weixi Zhai (Quanzhou Normal University); Jinhua Liang (Queen Mary University of London); Aidan O. T. Hogg (Queen Mary University of London); Simon Dixon (Queen Mary University of London) |
| Beyond Dry References: Learning Relative Audio Effects Representations via Contrastive Distance Learning | Xinlu Liu (Galaxy Audio Effect Team, Tencent Music Entertainment); Huibin Lin (Galaxy Audio Effect Team, Tencent Music Entertainment); Weixing Wei (Independent Researcher); Zhenhai Yan (Galaxy Audio Effect Team, Tencent Music Entertainment) |
| Explore This! Beat and Downbeat Tracking From a Learned Tatum Grid | Robert Kihlborg (KTH); André Holzapfel (KTH); Jan Schlüter (JKU Linz) |
| Stem-Specialized Multi-Gate Mixture-of-Experts for Joint Music Structure Analysis | Aneeka Azmat (Academia Sinica); Li Su (Academia Sinica); ChengHsin Hsu (National Tsing Hua University, Hsinchu City, Taiwan) |
| A Cross-Cultural Dataset of Instrumental Difficulty for Woodwinds and Strings | Rui Yang (Université de Lille); Mathieu Giraud (CNRS, Université de Lille); Florence Levé (Université de Picardie Jules-Verne) |
| Detection of AI-Generated Stems Within Hybrid Human-AI Music | François Rigaud (Deezer Research); Gabriel Meseguer Brocal (Deezer Research); Benjamin Martin (Deezer Research); Romain Hennequin (Deezer Research) |
| Culture-Specific Computational Musicology in Practice: DiArMaqAr (Digital Arabic Maqām Archive) | Khyam Allami (Music Intelligence Lab, American University of Beirut); Ibrahim El Khansa (Music Intelligence Lab, American University of Beiru); Mohammad El Asal (Music Intelligence Lab, American University of Beirut); Joseph Bakarji (Music Intelligence Lab, American University of Beirut) |
| Mitigating Structural Collapse in Multi-Codebook Autoregressive Music Generation via Structure-Aware Scheduled Sampling | Chen Feng Tsai (Academia Sinica); Mi-Yen Yeh (Academia Sinica) |
| From Prediction to Collaboration: Interactive Symbolic Music Analysis | Emmanouil Karystinaios (Johannes Kepler University); Johannes Hentschel (Anton Bruckner University); Markus Neuwirth (Anton Bruckner University); Gerhard Widmer (Johannes Kepler University) |
| Ghost In The Encoder: Decodable Artist Identity Representations In Lyrics-To-Song Generation | Arhan Vohra (Universitat Pompeu Fabra - MTG); Choenden Kyirong (Universitat Pompeu Fabra - MTG); Laura Ibañez (Universitat Pompeu Fabra); Martín Rocamora (Universitat Pompeu Fabra) |
| A First Benchmark and Metric for Evaluating Polyphony in Symbolic Music using Voice Independence | Eleanor Row (Queen Mary University of London); György Fazekas (Queen Mary University of London) |
| Evaluating Music Context Preservation: A Multi-Facet Framework for Music Editing Systems | Yash Vishe (University of California San Diego); Eric Xue (University of Chicago); Xunyi Jiang (University of California San Diego); Zachary Novack (University of California San Diego); Junda Wu (University of California San Diego); Julian McAuley (University of California San Diego); Xin Xu (University of California San Diego) |
| Learning Music Style for Piano Arrangement Through Cross-Modal Bootstrapping | Jingwei Zhao (Songscription); Gus Xia (MBZUAI); Ziyu Wang (New York University); Ye Wang (National University of Singapore) |
| Smorph: Playable Sound Morphing with Diffusion Models | Annie Chu (Northwestern University); Hugo Flores García (Adobe Inc.); Johannes Imort (Adobe Inc.); Oriol Nieto (Adobe Inc.); Bryan Pardo (Northwestern University); Jordan Rudess (Wizdom Music); Prem Seetharaman (Adobe Inc.); Justin Salamon (Adobe Inc.) |
| Does Notation Matter? MusicXML Tokenisation for Symbolic Music Generation and Understanding | Andrea Poltronieri (Music Technology Group - Universitat Pompeu Fabra); Matteo Spanio (University of Padua); Simone Chieppa (Music Technology Group - Universitat Pompeu Fabra); Xavier Serra (Music Technology Group - Universitat Pompeu Fabra); Martín Rocamora (Music Technology Group - Universitat Pompeu Fabra) |
| Geometric Iterative Retrieval for Neural Audio Codec Resynthesis | Leo Schmidt-Traub (ETH Zurich); Frederic Berdoz (ETH Zurich); Luca A. Lanzendörfer (ETH Zurich); Roger Wattenhofer (ETH Zurich) |
| Emergent Tonal Structure in Learned Chord Embeddings and Its Relation to Tonal Tension | Maral Ebrahimzadeh (Otto-von-Guericke-University Magdeburg); Gilberto Bernardes (University of Porto); Sebastian Stober (Otto-von-Guericke-University Magdeburg) |
| MambaVoice: Lightweight Audiovisual Singing Voice Separation via a Hybrid Mamba-Transformer Model | Adithi Shankar (Music Technology Group- Universitat Pompeu Fabra); Gopika Krishnan (Universitat Pompeu Fabra); Gloria Haro (Intelligent Multimodal Vision Analysis Group,Universitat Pompeu Fabra); Xavier Serra (Music Technology Group, Universitat Pompeu Fabra); Martín Rocamora (Music Technology Group, Universitat Pompeu Fabra) |
| Harmonic Representations in Symbolic Music Transformers are Localized and Controllable | Adi Silberschein (Weizmann Institute); Megan Wei (Brown University); Tamar Rott Shaham (Massachusetts Institute of Technology) |
| AllMusicCaps: Album Reviews as Complementary Supervision for Music CLAP | Pablo Alonso-Jiménez (Universitat Pompeu Fabra); Xavier Lizarraga-Seijas (Universitat Pompeu Fabra); Xavier Serra (Universitat Pompeu Fabra); Dmitry Bogdanov (Universitat Pompeu Fabra) |
| Comparing Compression-Based Models of Similarity in Jazz Harmonic Progressions | Xinyi Guan (EPFL); Edward T. R. Hall (EPFL); Zeng Ren (EPFL); Marina Borsodi-Benson (EPFL); Claire Pelofi (NYU); Martin Rohrmeier (EPFL) |
| Exploring Musical Taste : Analyzing User Content Preferences through Attention Mechanisms | Yan-Martin Tamm (University of Tartu); Anna Aljanaki (University of Tartu) |
| Do Joint Language-Audio Embeddings Encode Perceptual Timbre Semantics? | Qixin Deng (Northwestern University); Bryan Pardo (Northwestern University); Thrasyvoulos N. Pappas (Northwestern University) |
| RNGen: A Large Language Model Approach to Roman Numeral Analysis Toward Explainable Harmonic Analysis | Hewei Gao (Technical University of Denmark); Tim Beyer (Technical University of Munich); Xiaoxuan Wang (École Polytechnique Fédérale de Lausanne); Martin Rohrmeier (École Polytechnique Fédérale de Lausanne) |
| AudioCodex: Streaming Autoencoders for Live Audio | Marco Pasini (Queen Mary University of London); Javier Nistal (Sony Computer Science Laboratories Paris); Cyran Aouameur (Sony Computer Science Laboratories Paris); Stefan Lattner (Sony Computer Science Laboratories Paris); György Fazekas (Queen Mary University of London) |
| Assessing Factual Music Comprehension in Large Audio Language Models | Daniel Chenyu Lin (Cornell University); Michael Freeman (Cornell University); John Thickstun (Cornell University) |
| Learning to Predict Performance-induced Emotion Differences in Classical Piano Music | Joann Ching (Johannes Kepler University); Gerhard Widmer (Johannes Kepler University Linz) |
| An Open Corpus for Arabic Maqam Recognition | Peter Traver (New York University); Layth Sidiq (NYU Abu Dhabi); Robert Rowe (New York University); Andrew J. Eisenberg (NYU Abu Dhabi) |
| Spacing Out: On the Reliability of Binaural Music Source Separation Metrics | Richa Namballa (New York University); Magdalena Fuentes (New York University) |
| Diff2Mix: Controllable Music Mixing via Diffusion Models and Differentiable Audio Effects | Yisu Zong (Queen Mary University of London); Jinjie Shi (Queen Mary University of London); Joshua Reiss (Queen Mary University of London) |
| Cyclic Attractors in Iterated LLM-Based Symbolic Music Style Transfer | Jiarui Li (University of Edinburgh); Mark Liberman (University of Pennsylvania) |
| Live Music Denoising with Authentic Live Data and Track-Editing-Guided Semi-Supervised Learning | Penghao He (College of Computer Science and Artificial Intelligence, Fudan University); Xiankexin Luo (College of Computer Science and Artificial Intelligence, Fudan University); Wei Li (College of Computer Science and Artificial Intelligence, Fudan University) |
| MixWeaver: Stem-Aware Automatic DJ Transition Generation via Structured Discrete Optimization | Xuran Zhou (University of California San Diego); Xunyi Jiang (University of California San Diego); Churan Zhi (University of California San Diego); Junda Wu (University of California San Diego); Julian McAuley (University of California San Diego) |
| Beyond Piano: Cross-Instrument MIDI Velocity Estimation via Differentiable SoundFont Proxies | Zhanhong He (University of Western Australia); Hanyu Meng (University of New South Wales); David (Defeng) Huang (University of Western Australia); Roberto Togneri (University of Western Australia) |
| Local Multimodal Music Alignment from Global Supervision | Irmak Bukey (Carnegie Mellon University); Zachary Novack (University of California San Diego); Jongmin Jung (Neutune); Dasaem Jeong (Sogang University); Chris Donahue (Carnegie Mellon University) |
| Adapting Music Foundation Models to Iranian Classical Music | Pouya Mohseni (McGill University); Bagher BabaAli (University of Tehran); Ichiro Fujinaga (McGill University) |
| GlobalTap: Globally Diverse Beat Tracking Benchmark via Crowdsourced Tapping | William T. Botticelli-Wells (Cornell University); Manuel Anglada-Tort (Goldsmiths, University of London); Elif Celen (Max Planck Institute for Empirical Aesthetics); Rena Far (University of Toronto); Harin Lee (University of Cambridge); Peter M. C. Harrison (University of Cambridge); Nori Jacoby (Cornell University) |
| SmartLooper: a Framework for Personalized Human-AI Musical Improvisation | Finlay Miller (Dalhousie University); Sageev Oore (Dalhousie University); Chandramouli Sastry (Dalhousie University); Marvin da Silva (Dalhousie University); Sri Harsha Dumpala (Dalhousie University); Dani Oore (Independent); Scott Lowe (Vector Institute) |
| Digital Existence as Ontological Intervention: Backstage Networks in Postwar Taiwanese Popular Music | Ming Cheng (Academia Sinica); Yung-Chuan Chang (Academia Sinica); Chien-Chang Yang (National Taiwan University); Li Su (Academia Sinica) |
| D-Composer: Language Modeling for Simultaneous Drum Transcription and Sound Event Decomposition | Patrick O'Reilly (Northwestern University); Saumya Pailwan (Northwestern University); Annie Chu (Northwestern University); Jason Smith (Northwestern University); Bryan Pardo (Northwestern University) |
| Musicologically Interpretable Deep Learning Framework for Arabic Maqam Identification and Analysis | Joseph Bakarji (American University of Beirut); Khyam Allami (American University of Beirut); Mohammad El Asal (American University of Beirut); Dany Abou Jaoude (American University of Beirut) |
| SymSkill: Skill Graph for Symbolic Music Understanding | Junda Wu (University of California, San Diego); Boyang Wang (University of California, San Diego); Xunyi Jiang (University of California, San Diego); Aditya Yadavalli (University of California, San Diego); Ziyu Wang (New York University); Qianqi Yan (University of California, Santa Barbara); Hongyi Wen (New York University); Julian McAuley (University of California, San Diego) |
| Frame-Level Pansori Mode Classification with Complementary Audio Representations | Sangheon Park (Georgia Institute of Technology); Seonguk Ju (Sogang University); Suin Chung (Sogang University); Danbinaerin Han (KAIST); Dasaem Jeong (Sogang University) |
| Pitch Contour Tokenization using VQ-VAE and Its Application on Korean Traditional Music Analysis | Seonguk Ju (Department of Artificial Intelligence, Sogang University); Seola Cho (Department of Artificial Intelligence, Sogang University); Suin Chung (Sogang University); Danbinaerin Han (KAIST); Dasaem Jeong (Department of Art & Technology Sogang University) |
| Inferring Implied Harmonies through Voice Leading in Monophonic Instrumental Music Using Graph-Based Methods | Marina Borsodi-Benson (EPFL); Martin Rohrmeier (EPFL) |
| VioTech: Frame-Level Violin Playing Technique Detection with Multi-Scale Mixture-of-Experts | Ting-Kang Wang (Academia Sinica); Vincent K.M. Cheung (Sony Computer Science Laboratories, Inc.); Nan-Tien Lai (National Taiwan University); Li Su (Academia Sinica) |
| STRAdi: Real-Time Violin Transcription for Score Following | Sein Lee (KAIST); Jiyun Park (KAIST); Juhan Nam (KAIST) |
| Measuring Cross-Cultural Style Diffusion Through Era Classification: US and Korean Popular Music | Dasol Lee (Sogang University); Minhee Lee (KAIST); Seonguk Ju (Sogang University); Daewoong Kim (Sogang University); Harin Lee (University of Cambridge); Dasaem Jeong (Sogang University) |
| Separate-and-Detect: Unified Drum Transcription and Stem Generation via Latent Diffusion | Wei-Han Hsu (Data Science Degree Program, National Taiwan University and Academia Sinica, Taipei, Taiwan); Chih-Cheng Chang (Institute of Information Science, Academia Sinica, Taiwan); Bo-Yu Chen (Rhythm Culture Corporation); Li Su (Institute of Information Science, Academia Sinica, Taiwan); Yi-Hsuan Yang (Graduate Institute of Communication Engineering, National Taiwan University, Taiwan) |
| How Much AI Is in This Track? Quantifying the Proportion of AI-Generated Stems in Hybrid Music Mixtures | Fernando Garcia de la Cruz (Universitat Pompeu Fabra); David López-Ayala (Universitat Pompeu Fabra); Pablo Zinemanas (BMAT Music Innovators); Emilio Molina (BMAT Music Innovators); Martín Rocamora (Universitat Pompeu Fabra) |
| Measure for Measure: Reliable Evaluation and a New State of the Art for Full-Page Optical Music Recognition | Tobias Hornbogen (Hasso-Plattner-Institute); Josef Valentin (Hasso-Plattner-Institute) |
| Understanding Automatic Mixing: A Subtask-Oriented Analysis of Two-Stage Mixing System | Jinjie Shi (Queen Mary University of London); Wei Hua (Guangxi Arts University); Kunzhu Xie (Wuhan University of Communications); Make Li (Xinghai Conservatory of Music); Yuchen Liu (University College London); Joshua Reiss (Queen Mary University of London) |
| Vocal Music under Phoneme-Conditional Analysis | Hayoon Kim (Seoul National University); Kyogu Lee (Seoul National University) |
| Music Restoration via Latent Operator Optimization and Diffusion Model Priors | Michal Švento (Brno University of Technology); Eloi Moliner (Aalto University); Valtteri Kallinen (Aalto University); Lauri Juvela (Aalto University); Vesa Välimäki (Aalto University); Pavel Rajmic (Brno University of Technology) |
| Music Inpainting with Similarity-Guided Latent Diffusion | Sean Turland (University of Edinburgh); Eloi Moliner (Aalto University); Vesa Välimäki (Aalto University) |
| MetaMatch: Reconciling Metadata for Aggregating Music Difficulty Annotations | Megan E. Finch (Durham); Chris G. Willcocks (Durham); Mark R. H. Gotham (KCL) |
| I Just Kept Clicking Until It Hit: Exploring Virtual Instrument Search behavior and Challenges Across User Groups | Subeen Kim (Seoul National University); Eunsik Shin (Seoul National University); Woojae Cho (Seoul National University); Kyogu Lee (Seoul National University) |
| Real-Time Interactive Music Generation via Training-Data-Free Streaming Consistency Distillation | Baisen Wang (Institute of Information Engineering, Chinese Academy of Sciences); Chenxi Bao (DynamiX); Qisong Han (Cardiff University) |
| Assessing AI-Generated Music Detection in Real-World Broadcast Monitoring | David López-Ayala (Universitat Pompeu Fabra); Fernando Garcia de la Cruz (Universitat Pompeu Fabra); Pablo Zinemanas (BMAT Music Innovators); Emilio Molina (BMAT Music Innovators); Martín Rocamora (Universitat Pompeu Fabra) |
| InvFlowFD: Reference-Free and Background-Set-Free Perceptual Music Quality Metric with Flow Matching Inversion | Alon Ziv (The Hebrew University of Jerusalem); Harel Pogoda (The Hebrew University of Jerusalem); Yossi Adi (The Hebrew University of Jerusalem) |