Paper TitleAuthors
Off-Manifold Robustness in Synthesizer Inversion with Joint Distribution Flow MatchingBen Hayes (Sony Computer Science Laboratories Paris)
FusID: Modality-Fused Semantic IDs for Generative Music RecommendationHaven Kim (University of California San Diego); Yupeng Hou (University of California San Diego); Julian McAuley (University of California San Diego)
Dual-Time Representation Framework for Interactive Music TranscriptionYu Sugimoto (Kyushu University); Ryo Nishikimi (NTT Communication Science Laboratories); Eita Nakamura (Kyushu University)
TUTTI: Toward generalizable audio-to-score transcription via fully synthesized dataJianhuai Hu (Central Conservatory of Music); Yashan Wang (Central Conservatory of Music); Shangda Wu (Independent Researcher); Zhancheng Guo (Central Conservatory of Music); Shijie Liang (Central Conservatory of Music); Wuna Meng (Wuhan Conservatory of Music); Chuanqi Yang (Shanghai Conservatory of Music); Xiaobing Li (Central Conservatory of Music); Feng Yu (Central Conservatory of Music); Maosong Sun (TsingHua University)
Streaming Generation for Music AccompanimentYusong Wu (University of Montreal, Mila); Mason Wang (MIT); Heidi Lei (MIT); Stephen Brade (MIT); Lancelot Blanchard (MIT); Shih-Lun Wu (MIT); Aaron Courville (University of Montreal, Mila); Anna Huang (MIT)
Learning to Sing with Your Own Voice: Designing and Evaluating Generative AI-Assisted Vocal CoachingTianyu Gao (National University of Singapore); Shuqi Dai (Carnegie Mellon University); Roger B. Dannenberg (Carnegie Mellon University); Zhiyong Huang (National University of Singapore); Jin Song Dong (National University of Singapore); Jocelyn Dueck (Carnegie Mellon University)
Pitch Estimation and Vocal Melody Extraction with Self-supervised Phase ComparatorsLi Su (Academia Sinica)
MuScriptor: An Open Model for Multi-Instrument Music TranscriptionSimon Rouard (Kyutai); Michael Krause (Mirelo AI); Axel Roebel (IRCAM); Carl-Johann Simon-Gabriel (Mirelo AI); Alexandre Défossez (Kyutai)
Pitch Shifting via Semantic Transformations in a Shared Audio-Symbolic Latent SpaceBen Maman (International Audio Laboratories Erlangen); Andreas Brendel (Fraunhofer IIS Erlangen); Meinard Müller (International Audio Laboratories Erlangen)
Multi-Task Multi-Frame Visual Piano TranscriptionYonghyun Kim (Georgia Institute of Technology); Hoyeol Sohn (KAIST); Juhan Nam (KAIST); Alexander Lerch (Georgia Institute of Technology)
Investigating Ethiopian Kiñit in Secular Music: A Self-Supervised Learning and Computational AnalysisBerihu Yohannes Tesfay (Institute of Information Science, Academia Sinica; National Tsing Hua University; Mekelle University); Cheng-Hsin Hsu (National Tsing Hua University); Samuel Redie Fishatsion (Arts Academy, Mekelle University); Li Su (Institute of Information Science, Academia Sinica)
Towards Robust Version Identification in the Wild: A Dataset, Benchmark, and Fine-Tuning StudySimon Hachmeier (Humboldt-Universität zu Berlin); R. Oguz Araz (Universitat Pompeu Fabra); Dmitry Bogdanov (Universitat Pompeu Fabra); Robert Jäschke (Humboldt-Universität zu Berlin); Xavier Serra (Universitat Pompeu Fabra)
CrowdioSet and PaRIRset: Two Datasets Towards Live Music Source SeparationEnric Gusó (Universitat Pompeu Fabra); Xavier Serra (Universitat Pompeu Fabra)
Prima la Musica! Musically-Informed Symbolic Features for Section Boundary Detection in MIDIELVIO CIPOLLONE (Centre Culturel Buqi); FRANCESCO CIPOLLONE (Centre Culturel Buqi)
A Dataset and Benchmark for Optical Music Recognition of String Quartet ScoresDongMin Kim (Sogang University); Brian Liu (Independent Researcher); Jose J. Valero-Mas (University of Alicante); Dasaem Jeong (Sogang University)
The Debussy Dataset: Evaluating Optical Music Recognition on Modern Staff Notation ManuscriptsHugo Scheithauer (Inria); Thibault Clérice (Inria); Gonzalo Romero-García (EPITA)
VIOLET: High-Fidelity Violin Synthesis with Techniques and DynamicsBaotong Tian (University of Rochester); Cynthia Lu (University of Rochester); Vincent K.M. Cheung (Sony Computer Science Laboratories); Ting-Kang Wang (National Taiwan University); Jonathan Churchill (Embertone); Zhiyao Duan (University of Rochester)
DDSynth-RL: Audio Synthesizer Inversion via Discrete Diffusion with Reinforcement LearningTristan WU (Computational Media and Art, The Hong Kong University of Science and Technology (Guangzhou)); Daniel Chin (New York University Shanghai); Junan Zhang (The Chinese University of Hong Kong, Shenzhen); Junyan Jiang (New York University Shanghai); Yansen Jing (Department of Automation, Tsinghua University); Gus Xia (Mohamed bin Zayed University of Artificial Intelligence)
H2H Music Improv: A Communication Model and Audio-Visual Dataset for Music ImprovisationAleksandra Teng Ma (Georgia Institute of Technology); Anthony Cammarota (Georgia Institute of Technology); Jiayi Wang (Georgia Institute of Technology); Alexandria Smith (Georgia Institute of Technology); Cheng-Zhi Anna Huang (Massachusetts Institute of Technology); Jeffrey Albert (Georgia Institute of Technology); Alexander Lerch (Georgia Institute of Technology)
CODA: Cascaded Online Discontinuity-Aware Alignment for Real-Time Image-Based Score FollowingYining Yang (Western University); Ruogu Chen (University of Alberta); Jie Han (University of Alberta)
Low-Latency Real-Time Automatic Music Transcription with Band-Split RNN and Temporal LookaheadYuta Kusaka (Yamaha Corporation); Akira Maezawa (Yamaha Corporation)
StemFX: Learning Mixing Style Representations via Autoregressive FX Chain Prediction on Source-Separated StemsYuan-Chiao Cheng (Independent Researcher); Jui-Te Wu (Independent Researcher); Brian Chen (Independent Researcher); Yen-Tung Yeh (National Taiwan University); Yu-Hua Chen (National Taiwan University); Yi-Hsuan Yang (National Taiwan University)
Improved Robustness in AI-Generated Music DetectionEmile Dugelay (Centrale Lyon); Thomas Barand (Centrale Lyon); Aurélien Laouar (Centrale Lyon); Baptiste Campeas (Centrale Lyon); Darius Afchar (Deezer Research); Romain Hennequin (Deezer Research)
Toward Song Exploration Without Listening Through Lyrics-Derived Linguistic InformationKanako Suzuki (Waseda University); Kosetsu Tsukuda (National Institute of Advanced Industrial Science and Technology (AIST)); Takayuki Nakatsuka (National Institute of Advanced Industrial Science and Technology (AIST)); Kento Watanabe (National Institute of Advanced Industrial Science and Technology (AIST)); Tomoyasu Nakano (National Institute of Advanced Industrial Science and Technology (AIST)); Masataka Goto (National Institute of Advanced Industrial Science and Technology (AIST)); Keitaro Tanaka (Waseda Research Institute for Science and Engineering); Shigeo Morishima (Waseda Research Institute for Science and Engineering)
Masked Diffusion Enables Coherent Beat TrackingFrancesco Foscarin (Music AI); Filip Korzeniowski (Music AI); Richard Vogl (Music AI)
FMANet: Efficient and Lightweight Beat Tracking via Fourier Modulation AttentionGanghui Ru (Fudan University); Yi Yu (Hiroshima University); Wei Li (Fudan university)
Analyzing and Reducing the Synthetic-to-Real Transfer Gap in Music Information Retrieval: The Task of Automatic Drum TranscriptionMickaël Zehren (Umeå University); Marco Alunno (Universidad EAFIT Medellín); Paolo Bientinesi (Umeå University)
On the Geometry of Music Bandwidth Extension in Latent Spaces of Audio CodecsHendrik Vincent Koops (Universal Music Group); Hao Hao Tan (Universal Music Group); Elio Quinton (Universal Music Group)
Steering Dense Music Retrieval With Open-Vocabulary Concept DiscoveryJulien Guinot (Queen Mary University of London); Alain Riou (Universal Music Group); Elio Quinton (Universal Music Group); György Fazekas (Queen Mary University of London)
Estimating the Reliability of Dynamic Time Warping Alignments Using Circumstantial EvidenceAanya Pratapneni (Harvey Mudd College); Alice Yuan (Harvey Mudd College); TJ Tsai (Harvey Mudd College)
Rethinking Automatic Music Mixing as Sequential Stem BlendingYen-Tung Yeh (National Taiwan University); Chung-Jui Chan (National Taiwan University); Yun-Ning (Amy) Hung (Moises); Yi-Hsuan Yang (National Taiwan University)
TART: A Modular Tool For Technique-Aware Audio-To-Tablature Guitar TranscriptionAkshaj Gupta (Berkeley AI Research Lab); Hwi Joo Park (UC Berkeley); Andrea Guzman (UC Berkeley); Shamak Gowda (UC Berkeley); Samhita Konduri (UC Berkeley); Jiachen Lian (UC Berkeley); Robin Netzorg (UC Berkeley); Gopala Anumanchipalli (UC Berkeley)
Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty ModelingYishan Lv (Xi'an Jiaotong University); Jing Luo (Xi'an Jiaotong University); Boyuan Ju (Xi'an Jiaotong University); Yang Zhang (Xi'an Jiaotong University); Xinda Wu (Xi'an Jiaotong University); Bo Yuan (Xi'an Jiaotong University); Xinyu Yang (Xi'an Jiaotong University)
Exploring the Design Space of Representation Learning for Audio TransformationsSungho Lee (Seoul National University); Marco A. Martínez-Ramírez (Sony AI); Junghyun Koo (Sony AI); Wei-Hsiang Liao (Sony AI); Kyogu Lee (Seoul National University); Yuki Mitsufuji (Sony AI)
PEACE: Joint Embeddings of DSP Effects Code and AudioDavid Braun (Princeton University); Adam Finkelstein (Princeton University)
Improving Music Source Separation with Diffusion and Consistency RefinementTornike Karchkhadze (UC San Diego); Mohammad Rasool Izadi (bose); Shuo Zhang (Bose); Shlomo Dubnov (UC San Diego)
UOT-IR: Structured Routing of High-Polyphony Symbolic Music into Fixed-Budget RepresentationsZiyue Kang (FIST, Xi'an Jiaotong University;IRC of Frontier Science and Technology, Xi'an Jiaotong University); Nan Nan (FIST, Xi'an Jiaotong University;IRC of Frontier Science and Technology, Xi'an Jiaotong University;MOE KLINNS Lab, Xi'an Jiaotong University); Chenhao Lin (FIST, Xi'an Jiaotong University;IRC of Frontier Science and Technology, Xi'an Jiaotong University;MOE KLINNS Lab, Xi'an Jiaotong University); Xiaohong Guan (Xi'an Jiaotong University; Tsinghua University)
On the use of Pre-trained Audio Encoders for Audio-to-Score Music TranscriptionAntonio Hidalgo-Centeno (Pattern Recognition and Artificial Intelligence Group, University of Alicante); Carlos Penarrubia (Pattern Recognition and Artificial Intelligence Group, University of Alicante); Jose J. Valero-Mas (Pattern Recognition and Artificial Intelligence Group, University of Alicante)
MIDI-LLM: Improving Text-to-MIDI Music Generation via Adapting Large Language ModelsShih-Lun Wu (Massachusetts Institute of Technology); Dave Carlton (Hooktheory); Ryan Miyakawa (Hooktheory); Yoon Kim (Massachusetts Institute of Technology); Chris Donahue (Carnegie Mellon University); Cheng-Zhi Anna Huang (Massachusetts Institute of Technology)
Integrating Contextual Embeddings into Evaluation of Expressive MIDI Piano PerformancesDmitrii Gavrilev (Skolkovo Institute of Science and Technology); Ilya Borovik (Skolkovo Institute of Science and Technology); Vladimir Viro (Peachnote)
Beat This! Live - Online Beat and Downbeat Tracking by Predicting the FutureBánk Juhász (Johannes Kepler Universität Linz); Gerhard Widmer (Johannes Kepler Universität Linz); Jan Schlüter (Johannes Kepler Universität Linz)
Latent Trace Guidance for Generative Control Without Disentangled Data in Symbolic Melodic HarmonizationMaximos Kaliakatsos-Papakostas (Hellenic Mediterranean University); Dimos Makris (Hellenic Mediterranean University); Konstantinos-Theodoros Tsamis (Hellenic Mediterranean University); Konstantinos Soiledis (Hellenic Mediterranean University); Vassilis Katsouros (Athena Research Centre)
LiveBand: Live Accompaniment Generation in the Audio DomainMarco Pasini (Queen Mary University of London); Javier Nistal (Sony Computer Science Laboratories Paris); Mathias R. Bjare (Johannes Kepler University Linz); Stefan Lattner (Sony Computer Science Laboratories Paris); György Fazekas (Queen Mary University of London)
The Internet Archive Music DatasetParaskevas Stamatiadis (Telecom Paris); Bernardo V. Miranda (Telecom Paris); Clémentine Berger (Telecom Paris); Gaël Richard (Telecom Paris); Mathieu Fontaine (Telecom Paris); Slim Essid (NVIDIA)
Playability-Aware Audio-to-Tablature Guitar Transcription via Diffusion ModelsRiccardo Simionato (Universirty of Oslo); Louis Bigo (University of Bordeaux)
OudTabs: An Interactive Microtonal Tablature Platform for Cross-Tradition Oud RepertoiresAnıl Tuncel (ETH Zürich)
Full-page Recognition of Handwritten Jeongganbo music scores: Dataset and ApproachCarlos Penarrubia (University of Alicante); Danbinaerin Han (KAIST); Dasaem Jeong (Sogang University); Jose J Valero-Mas (University of Alicante)
Physiology-Driven Music Retrieval Using Contrastive LearningAnanth Venkatesh (Kings College London); Elaine Chew (Kings College London)
Equivariant Music TransformerZixun Guo (Singapore University of Technology and Design); Simon Dixon (Queen Mary University of London)
Learning Jazz Pianist Style with Cross-Attention ConditioningDrew Edwards (QMUL); Akira Maezawa (Yamaha Corporation); Simon Dixon (QMUL)
Recovering Affective Signals in Baroque Opera: A Comparative Evaluation of Human and LLM AnnotationCarlos Vaquero Patricio (ICCMU); Álvaro Torrente (ICCMU)
Interpretable Inverse Acoustic Modeling of Percussion via Physics-Guided Spectral DecompositionRajeev Rajan (Government Engineering College,Idukki, Kerala); Kevin Benty (APJ Abdul Kalam Technological University, India); Athul Joe Joseph Palliparambil (APJ Abdul Kalam Technological University, India)
Do Music Generative Models Understand Musical Qualities? Automatic Music Evaluation with Model-Intrinsic SignalsXiaosha Li (Georgia Institute of Technology); Chun Liu (ByteDance Inc.); Ziyu Wang (New York University)
From Prompting to Describing: A Cross-Cultural Study of Language for AI-Generated MusicSangheon Park (Georgia Institute of Technology); Claire Arthur (Georgia Institute of Technology)
Phase-Based Onset Enhancement for Piano Transcription in Ensemble SettingsHyemi Kim (KAIST / ETRI); Jiyun Park (KAIST); Juhan Nam (KAIST)
Online Music Concerts Leveraging Existing Music Videos: A Case Study on a Music Web ServiceKosetsu Tsukuda (National Institute of Advanced Industrial Science and Technology (AIST)); Keisuke Ishida (National Institute of Advanced Industrial Science and Technology (AIST)); Masahiro Hamasaki (National Institute of Advanced Industrial Science and Technology (AIST)); Masataka Goto (National Institute of Advanced Industrial Science and Technology (AIST))
VioLM: A Neural Language Model for Violin Synthesis with ArticulationSunan Zou (Peking University); Zhe Zhang (National Institute of Informatics); Yigitcan Özer (National Institute of Informatics); Guojie Luo (Peking University); Junichi Yamagishi (National Institute of Informatics)
Long, Short, and In Between: Non-Isochronous Models of Timing in Balkan Song PerformancesGeorge Sioros (University of Music and Performing Arts Vienna)
Genre Bias or Aesthetic Perception? Identifying and Mitigating Shortcut Learning in Music EvaluationYizhou Zhang (Kyoto University); Wangjin Zhou (Kyoto University); Yi Zhao (Tencent); Wei Tan (Tencent); Keisuke Imoto (Kyoto University); Zhi Gong (Tencent)
End-to-End Motif Discovery for Symbolic Polyphonic Music via Differentiable Label Propagation on Note-Pair GraphsRaynaldi Lalang (Kyoto University); Kazuyoshi Yoshii (Kyoto University)
Gugak-VocalSet: A Multi-Genre Studio-Quality Dataset of Korean Traditional Singing with Sigimsae AnnotationsDanbinaerin Han (KAIST); Wonil Kim (Neutune); Seah Hong (National Gugak Center); Dongjoo Moon (Neutune); Jaeok Lee (National Gugak Center); Jongpil Lee (Neutune); Chaewon Kim (National Gugak Center); Juhan Nam (KAIST)
Unified Music Identification for Tracks and VersionsR. Oguz Araz (Universitat Pompeu Fabra); Joan Serrà (Sony AI); Yuki Mitsufuji (Sony AI); Xavier Serra (Universitat Pompeu Fabra); Dmitry Bogdanov (Universitat Pompeu Fabra)
Do Music Foundation Models Embed Pitch in Helical Structure?Hayato Yagi (Keio University); Shinnosuke Takamichi (Keio University/ University of Tokyo); Rin Sato (Waseda University); Keitaro Tanaka (Waseda University); Shigeo Morishima (Waseda University)
When AI Annotates First: Measuring Its Impact on Music Score LabelingAlejandro Galan-Cuenca (University Institute for Computing Research, University of Alicante); Juan P. Martinez-Esteso (University Institute for Computing Research, University of Alicante); Carlos Pérez-Sancho (University Institute for Computing Research, University of Alicante); Francisco J. Castellanos (University Institute for Computing Research, University of Alicante); Antonio Javier Gallego (University Institute for Computing Research, University of Alicante)
SymphonyGen: 3D Hierarchical Orchestral Generation with Controllable Harmony SkeletonXuzheng He (Central Conservatory of Music); Nan Nan (Xi'an Jiaotong University); Zhilin Wang (University of Science and Technology of China); Ziyue Kang (Xi'an Jiaotong University); Zhuoru Mo (Shenzhen University); Ao Li (Xi'an Jiaotong University); Yu Pan (Central Conservatory of Music); Xiaobing Li (Central Conservatory of Music); Feng Yu (Central Conservatory of Music); Xiaohong Guan (Xi'an Jiaotong University)
Music Genre Classification Using Audio and Automatically Transcribed LyricsJun-You Wang (National Taiwan Normal University); Hsuan Yu Chen (National Taiwan Normal University)
Revisiting Two-Stage Audio Chord Recognition in the Deep-Learning Era: Leveraging Multi-Pitch Estimation and Symbolic PretrainingYiwei Ding (University of Würzburg); Yannik Venohr (University of Würzburg); Sebastian Strahl (International Audio Laboratories Erlangen); Meinard Müller (International Audio Laboratories Erlangen); Christof Weiß (University of Würzburg)
BARS: Beat-Adaptive Rap Synthesis via Flow MatchingTaemin Cho (BandLab Technologies); Hector Martel (BandLab Technologies); Enyan Koh (BandLab Technologies)
MPEcho: A Melody and Phoneme-Aware Generative Framework for Controllable Cover Song GenerationWei-Jaw Lee (National Taiwan University); Hsuan-Yu Yeh (National Taiwan University); Ting-Yi Hu (National Taiwan University); Chih-Pin Tan (National Taiwan University); Fang-Duo Tsai (National Taiwan University); Yi-Hsuan Yang (National Taiwan University)
What Makes a Good Layer? Assessing the Layer-Wise Intrinsic Properties of Music Foundation ModelsAngelos-Nikolaos Kanatas (Music Technology Group, Universitat Pompeu Fabra); Yuexuan Kong (Deezer Research); Pablo Alonso-Jiménez (Music Technology Group, Universitat Pompeu Fabra); Xavier Serra (Music Technology Group, Universitat Pompeu Fabra); Dmitry Bogdanov (Music Technology Group, Universitat Pompeu Fabra)
Musical Emotion under Cochlear Implant Listening: Human Perception and Foundation Model Representations of Human-Composed and AI-Generated MusicTaein Song (KAIST); Hyunjae Kim (KAIST); Kyung Myun Lee (KAIST)
Soft Late-Fusion Alignment and Pattern-Based Performance Analysis of Early 20th-Century Solo Flute MusicPatrice Thibaud (Univ. Lille, CNRS, Inria, Centrale Lille, UMR 9189 CRIStAL, F-59000 Lille, France); Louis Bigo (Univ. Bordeaux, CNRS, Bordeaux INP, LaBRI, UMR 5800, F-33400 Talence); Mathieu Giraud (Univ. Lille, CNRS, Inria, Centrale Lille, UMR 9189 CRIStAL, F-59000 Lille, France); Yann Teytaut (Univ. Lille, CNRS, Inria, Centrale Lille, UMR 9189 CRIStAL, F-59000 Lille, France)
Robust Instrument-Agnostic Music Transcription for Western Classical MusicYannik Venohr (University of Würzburg); Christof Weiß (University of Würzburg)
Pianoid: 3D Pianist Body Motion Generation from MIDIJoonhyung Bae (KAIST); Juhan Nam (KAIST)
More than words: Genre-Discriminating Lyrical Patterns in Anglophone German Popular MusicMarkus Radke (Technische Universität Berlin); Steffen Lepa (Technische Universität Berlin)
MEX: The Musical Expectation Benchmark SuiteMathias Rose Bjare (Johannes Kepler University Linz); Augustin Bouquillard (Max Planck Institute for Empirical Aesthetics); Giorgia Cantisani (Sciences et Technologies de la Musique et du Son, CNRS, IRCAM, Sorbonne Université); Seung-Goo Kim (Max Planck Institute for Empirical Aesthetics); Stefan Lattner (Sony Computer Science Laboratories (CSL), Paris); Gerhard Widmer (Johannes Kepler University Linz)
SKY-Piano: A Multimodal Piano Performance DatasetJoonhyung Bae (KAIST); Dawon Park (Seoul National University); Taegyun Kwon (KAIST); Yoon-Seok Choi (Seoul National University); Hyeon Hur (Seoul National University); Satoshi Obata (YAMAHA); Shigeru Kai (YAMAHA); Yohei Wada (YAMAHA); Yu Takahashi (YAMAHA); Akira Maezawa (YAMAHA); Jaebum Park (Seoul National University); Jonghwa Park (Seoul National University); Juhan Nam (KAIST)
CapCyCin: Improving Music Captioning through Cycle-Consistent Music–Text AlignmentSaeyeon Hwang (Department of Data Science, Graduate School of Data Science, Seoul National University); Kyungsu Kim (Department of Intelligence and Information, Graduate School of Convergence Science and Technology, Seoul National University); Kyogu Lee (IPAI, Department of Intelligence and Information, AIIS, Seoul National University)
Human Performance in Lyric Topic Classification: Evaluation and ImplicationsVarvara Papazoglou (University of Sheffield); Robert Gaizauskas (University of Sheffield); Alexandros Stamatiadis (Independent Researcher)
CoALa: A Plugin Model for Controlling Audio LatentsSarah Nabi (IRCAM); Nabarun Goswami (The University of Tokyo); Philippe Esling (IRCAM); Geoffroy Peeters (Telecom Paris); Frédéric Bevilacqua (IRCAM); Tatsuya Harada (The University of Tokyo)
MAJEPPA: Morphing and Assessing in a Unified Piano Performance SpaceJinwen Zhou (Queen Mary University of London); Huan Zhang (Queen Mary University of London); Weixi Zhai (Quanzhou Normal University); Jinhua Liang (Queen Mary University of London); Aidan O. T. Hogg (Queen Mary University of London); Simon Dixon (Queen Mary University of London)
Beyond Dry References: Learning Relative Audio Effects Representations via Contrastive Distance LearningXinlu Liu (Galaxy Audio Effect Team, Tencent Music Entertainment); Huibin Lin (Galaxy Audio Effect Team, Tencent Music Entertainment); Weixing Wei (Independent Researcher); Zhenhai Yan (Galaxy Audio Effect Team, Tencent Music Entertainment)
Explore This! Beat and Downbeat Tracking From a Learned Tatum GridRobert Kihlborg (KTH); André Holzapfel (KTH); Jan Schlüter (JKU Linz)
Stem-Specialized Multi-Gate Mixture-of-Experts for Joint Music Structure AnalysisAneeka Azmat (Academia Sinica); Li Su (Academia Sinica); ChengHsin Hsu (National Tsing Hua University, Hsinchu City, Taiwan)
A Cross-Cultural Dataset of Instrumental Difficulty for Woodwinds and StringsRui Yang (Université de Lille); Mathieu Giraud (CNRS, Université de Lille); Florence Levé (Université de Picardie Jules-Verne)
Detection of AI-Generated Stems Within Hybrid Human-AI MusicFrançois Rigaud (Deezer Research); Gabriel Meseguer Brocal (Deezer Research); Benjamin Martin (Deezer Research); Romain Hennequin (Deezer Research)
Culture-Specific Computational Musicology in Practice: DiArMaqAr (Digital Arabic Maqām Archive)Khyam Allami (Music Intelligence Lab, American University of Beirut); Ibrahim El Khansa (Music Intelligence Lab, American University of Beiru); Mohammad El Asal (Music Intelligence Lab, American University of Beirut); Joseph Bakarji (Music Intelligence Lab, American University of Beirut)
Mitigating Structural Collapse in Multi-Codebook Autoregressive Music Generation via Structure-Aware Scheduled SamplingChen Feng Tsai (Academia Sinica); Mi-Yen Yeh (Academia Sinica)
From Prediction to Collaboration: Interactive Symbolic Music AnalysisEmmanouil Karystinaios (Johannes Kepler University); Johannes Hentschel (Anton Bruckner University); Markus Neuwirth (Anton Bruckner University); Gerhard Widmer (Johannes Kepler University)
Ghost In The Encoder: Decodable Artist Identity Representations In Lyrics-To-Song GenerationArhan Vohra (Universitat Pompeu Fabra - MTG); Choenden Kyirong (Universitat Pompeu Fabra - MTG); Laura Ibañez (Universitat Pompeu Fabra); Martín Rocamora (Universitat Pompeu Fabra)
A First Benchmark and Metric for Evaluating Polyphony in Symbolic Music using Voice IndependenceEleanor Row (Queen Mary University of London); György Fazekas (Queen Mary University of London)
Evaluating Music Context Preservation: A Multi-Facet Framework for Music Editing SystemsYash Vishe (University of California San Diego); Eric Xue (University of Chicago); Xunyi Jiang (University of California San Diego); Zachary Novack (University of California San Diego); Junda Wu (University of California San Diego); Julian McAuley (University of California San Diego); Xin Xu (University of California San Diego)
Learning Music Style for Piano Arrangement Through Cross-Modal BootstrappingJingwei Zhao (Songscription); Gus Xia (MBZUAI); Ziyu Wang (New York University); Ye Wang (National University of Singapore)
Smorph: Playable Sound Morphing with Diffusion ModelsAnnie Chu (Northwestern University); Hugo Flores García (Adobe Inc.); Johannes Imort (Adobe Inc.); Oriol Nieto (Adobe Inc.); Bryan Pardo (Northwestern University); Jordan Rudess (Wizdom Music); Prem Seetharaman (Adobe Inc.); Justin Salamon (Adobe Inc.)
Does Notation Matter? MusicXML Tokenisation for Symbolic Music Generation and UnderstandingAndrea Poltronieri (Music Technology Group - Universitat Pompeu Fabra); Matteo Spanio (University of Padua); Simone Chieppa (Music Technology Group - Universitat Pompeu Fabra); Xavier Serra (Music Technology Group - Universitat Pompeu Fabra); Martín Rocamora (Music Technology Group - Universitat Pompeu Fabra)
Geometric Iterative Retrieval for Neural Audio Codec ResynthesisLeo Schmidt-Traub (ETH Zurich); Frederic Berdoz (ETH Zurich); Luca A. Lanzendörfer (ETH Zurich); Roger Wattenhofer (ETH Zurich)
Emergent Tonal Structure in Learned Chord Embeddings and Its Relation to Tonal TensionMaral Ebrahimzadeh (Otto-von-Guericke-University Magdeburg); Gilberto Bernardes (University of Porto); Sebastian Stober (Otto-von-Guericke-University Magdeburg)
MambaVoice: Lightweight Audiovisual Singing Voice Separation via a Hybrid Mamba-Transformer ModelAdithi Shankar (Music Technology Group- Universitat Pompeu Fabra); Gopika Krishnan (Universitat Pompeu Fabra); Gloria Haro (Intelligent Multimodal Vision Analysis Group,Universitat Pompeu Fabra); Xavier Serra (Music Technology Group, Universitat Pompeu Fabra); Martín Rocamora (Music Technology Group, Universitat Pompeu Fabra)
Harmonic Representations in Symbolic Music Transformers are Localized and ControllableAdi Silberschein (Weizmann Institute); Megan Wei (Brown University); Tamar Rott Shaham (Massachusetts Institute of Technology)
AllMusicCaps: Album Reviews as Complementary Supervision for Music CLAPPablo Alonso-Jiménez (Universitat Pompeu Fabra); Xavier Lizarraga-Seijas (Universitat Pompeu Fabra); Xavier Serra (Universitat Pompeu Fabra); Dmitry Bogdanov (Universitat Pompeu Fabra)
Comparing Compression-Based Models of Similarity in Jazz Harmonic ProgressionsXinyi Guan (EPFL); Edward T. R. Hall (EPFL); Zeng Ren (EPFL); Marina Borsodi-Benson (EPFL); Claire Pelofi (NYU); Martin Rohrmeier (EPFL)
Exploring Musical Taste : Analyzing User Content Preferences through Attention MechanismsYan-Martin Tamm (University of Tartu); Anna Aljanaki (University of Tartu)
Do Joint Language-Audio Embeddings Encode Perceptual Timbre Semantics?Qixin Deng (Northwestern University); Bryan Pardo (Northwestern University); Thrasyvoulos N. Pappas (Northwestern University)
RNGen: A Large Language Model Approach to Roman Numeral Analysis Toward Explainable Harmonic AnalysisHewei Gao (Technical University of Denmark); Tim Beyer (Technical University of Munich); Xiaoxuan Wang (École Polytechnique Fédérale de Lausanne); Martin Rohrmeier (École Polytechnique Fédérale de Lausanne)
AudioCodex: Streaming Autoencoders for Live AudioMarco Pasini (Queen Mary University of London); Javier Nistal (Sony Computer Science Laboratories Paris); Cyran Aouameur (Sony Computer Science Laboratories Paris); Stefan Lattner (Sony Computer Science Laboratories Paris); György Fazekas (Queen Mary University of London)
Assessing Factual Music Comprehension in Large Audio Language ModelsDaniel Chenyu Lin (Cornell University); Michael Freeman (Cornell University); John Thickstun (Cornell University)
Learning to Predict Performance-induced Emotion Differences in Classical Piano MusicJoann Ching (Johannes Kepler University); Gerhard Widmer (Johannes Kepler University Linz)
An Open Corpus for Arabic Maqam RecognitionPeter Traver (New York University); Layth Sidiq (NYU Abu Dhabi); Robert Rowe (New York University); Andrew J. Eisenberg (NYU Abu Dhabi)
Spacing Out: On the Reliability of Binaural Music Source Separation MetricsRicha Namballa (New York University); Magdalena Fuentes (New York University)
Diff2Mix: Controllable Music Mixing via Diffusion Models and Differentiable Audio EffectsYisu Zong (Queen Mary University of London); Jinjie Shi (Queen Mary University of London); Joshua Reiss (Queen Mary University of London)
Cyclic Attractors in Iterated LLM-Based Symbolic Music Style TransferJiarui Li (University of Edinburgh); Mark Liberman (University of Pennsylvania)
Live Music Denoising with Authentic Live Data and Track-Editing-Guided Semi-Supervised LearningPenghao He (College of Computer Science and Artificial Intelligence, Fudan University); Xiankexin Luo (College of Computer Science and Artificial Intelligence, Fudan University); Wei Li (College of Computer Science and Artificial Intelligence, Fudan University)
MixWeaver: Stem-Aware Automatic DJ Transition Generation via Structured Discrete OptimizationXuran Zhou (University of California San Diego); Xunyi Jiang (University of California San Diego); Churan Zhi (University of California San Diego); Junda Wu (University of California San Diego); Julian McAuley (University of California San Diego)
Beyond Piano: Cross-Instrument MIDI Velocity Estimation via Differentiable SoundFont ProxiesZhanhong He (University of Western Australia); Hanyu Meng (University of New South Wales); David (Defeng) Huang (University of Western Australia); Roberto Togneri (University of Western Australia)
Local Multimodal Music Alignment from Global SupervisionIrmak Bukey (Carnegie Mellon University); Zachary Novack (University of California San Diego); Jongmin Jung (Neutune); Dasaem Jeong (Sogang University); Chris Donahue (Carnegie Mellon University)
Adapting Music Foundation Models to Iranian Classical MusicPouya Mohseni (McGill University); Bagher BabaAli (University of Tehran); Ichiro Fujinaga (McGill University)
GlobalTap: Globally Diverse Beat Tracking Benchmark via Crowdsourced TappingWilliam T. Botticelli-Wells (Cornell University); Manuel Anglada-Tort (Goldsmiths, University of London); Elif Celen (Max Planck Institute for Empirical Aesthetics); Rena Far (University of Toronto); Harin Lee (University of Cambridge); Peter M. C. Harrison (University of Cambridge); Nori Jacoby (Cornell University)
SmartLooper: a Framework for Personalized Human-AI Musical ImprovisationFinlay Miller (Dalhousie University); Sageev Oore (Dalhousie University); Chandramouli Sastry (Dalhousie University); Marvin da Silva (Dalhousie University); Sri Harsha Dumpala (Dalhousie University); Dani Oore (Independent); Scott Lowe (Vector Institute)
Digital Existence as Ontological Intervention: Backstage Networks in Postwar Taiwanese Popular MusicMing Cheng (Academia Sinica); Yung-Chuan Chang (Academia Sinica); Chien-Chang Yang (National Taiwan University); Li Su (Academia Sinica)
D-Composer: Language Modeling for Simultaneous Drum Transcription and Sound Event DecompositionPatrick O'Reilly (Northwestern University); Saumya Pailwan (Northwestern University); Annie Chu (Northwestern University); Jason Smith (Northwestern University); Bryan Pardo (Northwestern University)
Musicologically Interpretable Deep Learning Framework for Arabic Maqam Identification and AnalysisJoseph Bakarji (American University of Beirut); Khyam Allami (American University of Beirut); Mohammad El Asal (American University of Beirut); Dany Abou Jaoude (American University of Beirut)
SymSkill: Skill Graph for Symbolic Music UnderstandingJunda Wu (University of California, San Diego); Boyang Wang (University of California, San Diego); Xunyi Jiang (University of California, San Diego); Aditya Yadavalli (University of California, San Diego); Ziyu Wang (New York University); Qianqi Yan (University of California, Santa Barbara); Hongyi Wen (New York University); Julian McAuley (University of California, San Diego)
Frame-Level Pansori Mode Classification with Complementary Audio RepresentationsSangheon Park (Georgia Institute of Technology); Seonguk Ju (Sogang University); Suin Chung (Sogang University); Danbinaerin Han (KAIST); Dasaem Jeong (Sogang University)
Pitch Contour Tokenization using VQ-VAE and Its Application on Korean Traditional Music AnalysisSeonguk Ju (Department of Artificial Intelligence, Sogang University); Seola Cho (Department of Artificial Intelligence, Sogang University); Suin Chung (Sogang University); Danbinaerin Han (KAIST); Dasaem Jeong (Department of Art & Technology Sogang University)
Inferring Implied Harmonies through Voice Leading in Monophonic Instrumental Music Using Graph-Based MethodsMarina Borsodi-Benson (EPFL); Martin Rohrmeier (EPFL)
VioTech: Frame-Level Violin Playing Technique Detection with Multi-Scale Mixture-of-ExpertsTing-Kang Wang (Academia Sinica); Vincent K.M. Cheung (Sony Computer Science Laboratories, Inc.); Nan-Tien Lai (National Taiwan University); Li Su (Academia Sinica)
STRAdi: Real-Time Violin Transcription for Score FollowingSein Lee (KAIST); Jiyun Park (KAIST); Juhan Nam (KAIST)
Measuring Cross-Cultural Style Diffusion Through Era Classification: US and Korean Popular MusicDasol Lee (Sogang University); Minhee Lee (KAIST); Seonguk Ju (Sogang University); Daewoong Kim (Sogang University); Harin Lee (University of Cambridge); Dasaem Jeong (Sogang University)
Separate-and-Detect: Unified Drum Transcription and Stem Generation via Latent DiffusionWei-Han Hsu (Data Science Degree Program, National Taiwan University and Academia Sinica, Taipei, Taiwan); Chih-Cheng Chang (Institute of Information Science, Academia Sinica, Taiwan); Bo-Yu Chen (Rhythm Culture Corporation); Li Su (Institute of Information Science, Academia Sinica, Taiwan); Yi-Hsuan Yang (Graduate Institute of Communication Engineering, National Taiwan University, Taiwan)
How Much AI Is in This Track? Quantifying the Proportion of AI-Generated Stems in Hybrid Music MixturesFernando Garcia de la Cruz (Universitat Pompeu Fabra); David López-Ayala (Universitat Pompeu Fabra); Pablo Zinemanas (BMAT Music Innovators); Emilio Molina (BMAT Music Innovators); Martín Rocamora (Universitat Pompeu Fabra)
Measure for Measure: Reliable Evaluation and a New State of the Art for Full-Page Optical Music RecognitionTobias Hornbogen (Hasso-Plattner-Institute); Josef Valentin (Hasso-Plattner-Institute)
Understanding Automatic Mixing: A Subtask-Oriented Analysis of Two-Stage Mixing SystemJinjie Shi (Queen Mary University of London); Wei Hua (Guangxi Arts University); Kunzhu Xie (Wuhan University of Communications); Make Li (Xinghai Conservatory of Music); Yuchen Liu (University College London); Joshua Reiss (Queen Mary University of London)
Vocal Music under Phoneme-Conditional AnalysisHayoon Kim (Seoul National University); Kyogu Lee (Seoul National University)
Music Restoration via Latent Operator Optimization and Diffusion Model PriorsMichal Švento (Brno University of Technology); Eloi Moliner (Aalto University); Valtteri Kallinen (Aalto University); Lauri Juvela (Aalto University); Vesa Välimäki (Aalto University); Pavel Rajmic (Brno University of Technology)
Music Inpainting with Similarity-Guided Latent DiffusionSean Turland (University of Edinburgh); Eloi Moliner (Aalto University); Vesa Välimäki (Aalto University)
MetaMatch: Reconciling Metadata for Aggregating Music Difficulty AnnotationsMegan E. Finch (Durham); Chris G. Willcocks (Durham); Mark R. H. Gotham (KCL)
I Just Kept Clicking Until It Hit: Exploring Virtual Instrument Search behavior and Challenges Across User GroupsSubeen Kim (Seoul National University); Eunsik Shin (Seoul National University); Woojae Cho (Seoul National University); Kyogu Lee (Seoul National University)
Real-Time Interactive Music Generation via Training-Data-Free Streaming Consistency DistillationBaisen Wang (Institute of Information Engineering, Chinese Academy of Sciences); Chenxi Bao (DynamiX); Qisong Han (Cardiff University)
Assessing AI-Generated Music Detection in Real-World Broadcast MonitoringDavid López-Ayala (Universitat Pompeu Fabra); Fernando Garcia de la Cruz (Universitat Pompeu Fabra); Pablo Zinemanas (BMAT Music Innovators); Emilio Molina (BMAT Music Innovators); Martín Rocamora (Universitat Pompeu Fabra)
InvFlowFD: Reference-Free and Background-Set-Free Perceptual Music Quality Metric with Flow Matching InversionAlon Ziv (The Hebrew University of Jerusalem); Harel Pogoda (The Hebrew University of Jerusalem); Yossi Adi (The Hebrew University of Jerusalem)