什么是音频转MIDI?

音频转MIDI工具通过音高检测,将音频录音转换为MIDI音符数据。上传人声旋律、吉他即兴片段或任何单音音频,即可获得可下载的MIDI文件,导入任何数字音频工作站使用。

音高检测使用 YIN 算法,逐帧估算基频,然后把稳定的帧量化到最接近的半音。单音音源效果最好:人声、长笛、独奏吉他、口哨旋律。和弦或鼓声等复音内容,识别结果不可控。

使用方法

  1. 上传包含单音旋律的音频文件(WAV、MP3或OGG格式)——每次演奏一个音符效果最佳。
  2. 调整最低置信度阈值和最短音符时长,过滤噪音和短暂的瞬态信号。
  3. 在钢琴卷帘窗中预览检测到的音符,然后将结果下载为标准MIDI文件。

何时使用

  • 用手机录一段哼唱的灵感,转成 MIDI 拖进 DAW 做编曲草稿。
  • 把长笛或口哨旋律转成乐谱,不用再凭耳朵扒带。
  • 把吉他乐句的旋律抠出来,用合成器音色重新触发,做成不同质感的版本。

结果

一位歌手用手机录制了一段即兴哼唱的旋律。将MP3上传到这里,工具会检测每个唱出的音高和时值,导出MIDI文件后直接拖入Ableton Live,用合成器回放。

常见问题

为什么有些音漏检,或者多出奇怪的音?
气声起音、超过半音的颤音、重叠的音都会干扰检测。把「最小置信度」滑块调高,可以过滤掉不稳定的判断。录音环境干一些、混响少一些,识别会更准。一次唱一个音,别连音。
可以扒整首带和弦和鼓的歌吗?
不能。算法只识别单音,同时响的多个音会让它混乱,输出会很乱。请先把人声或贝斯单独导出再上传。复音扒带需要更重的模型,本工具不做这件事。
支持哪些音频格式?
WAV、MP3、OGG、FLAC 都可以。解码由 Web Audio API 在本设备本地完成,所以这台设备能播的文件基本都能识别。单声道和立体声都接受,立体声会先合并成单声道再分析。
检测出来的音整体高了或低了一个八度,怎么回事?
音高检测器有时会锁到泛音而不是基频,导致八度跑偏。用「八度」控件把整段往上或往下挪一格就行。低频丰富的录音(比如电贝斯)最容易出现这种问题。
导出的 MIDI 会保留原始的时值吗?
会。每个音符的起始时间和时值都按毫秒写入,所以 MIDI 的节奏跟原录音对齐,不会自动对齐到网格。如果想量化,在 DAW 里导入后再处理即可。

相关工具