audio.go 8.1 KB

123456789101112131415161718192021222324252627282930313233343536373839404142434445464748495051525354555657585960616263646566676869707172737475767778798081828384858687888990919293949596979899100101102103104105106107108109110111112113114115116117118119120121122123124125126127128129130131132133134135136137138139140141142143144145146147148149150151152153154155156157158159160161162163164165166167168169170171172173174175176177178179180181182183184185186187188189190191192193194195196197198199200201202203204205206207208209210211212213214215216217218219220221222223224225226227228229230231232233234235236237238239240241242243244245246247248249250251252253254255256257258259260261262263264265266267268269270271272273274275276277278279280281282283284285286287288289290291292293294295
  1. package common
  2. import (
  3. "context"
  4. "encoding/binary"
  5. "fmt"
  6. "io"
  7. "github.com/abema/go-mp4"
  8. "github.com/go-audio/aiff"
  9. "github.com/go-audio/wav"
  10. "github.com/jfreymuth/oggvorbis"
  11. "github.com/mewkiz/flac"
  12. "github.com/pkg/errors"
  13. "github.com/tcolgate/mp3"
  14. "github.com/yapingcat/gomedia/go-codec"
  15. )
  16. // GetAudioDuration 使用纯 Go 库获取音频文件的时长(秒)。
  17. // 它不再依赖外部的 ffmpeg 或 ffprobe 程序。
  18. func GetAudioDuration(ctx context.Context, f io.ReadSeeker, ext string) (duration float64, err error) {
  19. SysLog(fmt.Sprintf("GetAudioDuration: ext=%s", ext))
  20. // 根据文件扩展名选择解析器
  21. switch ext {
  22. case ".mp3":
  23. duration, err = getMP3Duration(f)
  24. case ".wav":
  25. duration, err = getWAVDuration(f)
  26. case ".flac":
  27. duration, err = getFLACDuration(f)
  28. case ".m4a", ".mp4":
  29. duration, err = getM4ADuration(f)
  30. case ".ogg", ".oga":
  31. duration, err = getOGGDuration(f)
  32. case ".opus":
  33. duration, err = getOpusDuration(f)
  34. case ".aiff", ".aif", ".aifc":
  35. duration, err = getAIFFDuration(f)
  36. case ".webm":
  37. duration, err = getWebMDuration(f)
  38. case ".aac":
  39. duration, err = getAACDuration(f)
  40. default:
  41. return 0, fmt.Errorf("unsupported audio format: %s", ext)
  42. }
  43. SysLog(fmt.Sprintf("GetAudioDuration: duration=%f", duration))
  44. return duration, err
  45. }
  46. // getMP3Duration 解析 MP3 文件以获取时长。
  47. // 注意:对于 VBR (Variable Bitrate) MP3,这个估算可能不完全精确,但通常足够好。
  48. // FFmpeg 在这种情况下会扫描整个文件来获得精确值,但这里的库提供了快速估算。
  49. func getMP3Duration(r io.Reader) (float64, error) {
  50. d := mp3.NewDecoder(r)
  51. var f mp3.Frame
  52. skipped := 0
  53. duration := 0.0
  54. for {
  55. if err := d.Decode(&f, &skipped); err != nil {
  56. if err == io.EOF {
  57. break
  58. }
  59. return 0, errors.Wrap(err, "failed to decode mp3 frame")
  60. }
  61. duration += f.Duration().Seconds()
  62. }
  63. return duration, nil
  64. }
  65. // getWAVDuration 解析 WAV 文件头以获取时长。
  66. func getWAVDuration(r io.ReadSeeker) (float64, error) {
  67. dec := wav.NewDecoder(r)
  68. if !dec.IsValidFile() {
  69. return 0, errors.New("invalid wav file")
  70. }
  71. d, err := dec.Duration()
  72. if err != nil {
  73. return 0, errors.Wrap(err, "failed to get wav duration")
  74. }
  75. return d.Seconds(), nil
  76. }
  77. // getFLACDuration 解析 FLAC 文件的 STREAMINFO 块。
  78. func getFLACDuration(r io.Reader) (float64, error) {
  79. stream, err := flac.Parse(r)
  80. if err != nil {
  81. return 0, errors.Wrap(err, "failed to parse flac stream")
  82. }
  83. defer stream.Close()
  84. // 时长 = 总采样数 / 采样率
  85. duration := float64(stream.Info.NSamples) / float64(stream.Info.SampleRate)
  86. return duration, nil
  87. }
  88. // getM4ADuration 解析 M4A/MP4 文件的 'mvhd' box。
  89. func getM4ADuration(r io.ReadSeeker) (float64, error) {
  90. // go-mp4 库需要 ReadSeeker 接口
  91. info, err := mp4.Probe(r)
  92. if err != nil {
  93. return 0, errors.Wrap(err, "failed to probe m4a/mp4 file")
  94. }
  95. // 时长 = Duration / Timescale
  96. return float64(info.Duration) / float64(info.Timescale), nil
  97. }
  98. // getOGGDuration 解析 OGG/Vorbis 文件以获取时长。
  99. func getOGGDuration(r io.ReadSeeker) (float64, error) {
  100. // 重置 reader 到开头
  101. if _, err := r.Seek(0, io.SeekStart); err != nil {
  102. return 0, errors.Wrap(err, "failed to seek ogg file")
  103. }
  104. reader, err := oggvorbis.NewReader(r)
  105. if err != nil {
  106. return 0, errors.Wrap(err, "failed to create ogg vorbis reader")
  107. }
  108. // 计算时长 = 总采样数 / 采样率
  109. // 需要读取整个文件来获取总采样数
  110. channels := reader.Channels()
  111. sampleRate := reader.SampleRate()
  112. // 估算方法:读取到文件结尾
  113. var totalSamples int64
  114. buf := make([]float32, 4096*channels)
  115. for {
  116. n, err := reader.Read(buf)
  117. if err == io.EOF {
  118. break
  119. }
  120. if err != nil {
  121. return 0, errors.Wrap(err, "failed to read ogg samples")
  122. }
  123. totalSamples += int64(n / channels)
  124. }
  125. duration := float64(totalSamples) / float64(sampleRate)
  126. return duration, nil
  127. }
  128. // getOpusDuration 解析 Opus 文件(在 OGG 容器中)以获取时长。
  129. func getOpusDuration(r io.ReadSeeker) (float64, error) {
  130. // Opus 通常封装在 OGG 容器中
  131. // 我们需要解析 OGG 页面来获取时长信息
  132. if _, err := r.Seek(0, io.SeekStart); err != nil {
  133. return 0, errors.Wrap(err, "failed to seek opus file")
  134. }
  135. // 读取 OGG 页面头部
  136. var totalGranulePos int64
  137. buf := make([]byte, 27) // OGG 页面头部最小大小
  138. for {
  139. n, err := r.Read(buf)
  140. if err == io.EOF {
  141. break
  142. }
  143. if err != nil {
  144. return 0, errors.Wrap(err, "failed to read opus/ogg page")
  145. }
  146. if n < 27 {
  147. break
  148. }
  149. // 检查 OGG 页面标识 "OggS"
  150. if string(buf[0:4]) != "OggS" {
  151. // 跳过一些字节继续寻找
  152. if _, err := r.Seek(-26, io.SeekCurrent); err != nil {
  153. break
  154. }
  155. continue
  156. }
  157. // 读取 granule position (字节 6-13, 小端序)
  158. granulePos := int64(binary.LittleEndian.Uint64(buf[6:14]))
  159. if granulePos > totalGranulePos {
  160. totalGranulePos = granulePos
  161. }
  162. // 读取段表大小
  163. numSegments := int(buf[26])
  164. segmentTable := make([]byte, numSegments)
  165. if _, err := io.ReadFull(r, segmentTable); err != nil {
  166. break
  167. }
  168. // 计算页面数据大小并跳过
  169. var pageSize int
  170. for _, segSize := range segmentTable {
  171. pageSize += int(segSize)
  172. }
  173. if _, err := r.Seek(int64(pageSize), io.SeekCurrent); err != nil {
  174. break
  175. }
  176. }
  177. // Opus 的采样率固定为 48000 Hz
  178. duration := float64(totalGranulePos) / 48000.0
  179. return duration, nil
  180. }
  181. // getAIFFDuration 解析 AIFF 文件头以获取时长。
  182. func getAIFFDuration(r io.ReadSeeker) (float64, error) {
  183. if _, err := r.Seek(0, io.SeekStart); err != nil {
  184. return 0, errors.Wrap(err, "failed to seek aiff file")
  185. }
  186. dec := aiff.NewDecoder(r)
  187. if !dec.IsValidFile() {
  188. return 0, errors.New("invalid aiff file")
  189. }
  190. d, err := dec.Duration()
  191. if err != nil {
  192. return 0, errors.Wrap(err, "failed to get aiff duration")
  193. }
  194. return d.Seconds(), nil
  195. }
  196. // getWebMDuration 解析 WebM 文件以获取时长。
  197. // WebM 使用 Matroska 容器格式
  198. func getWebMDuration(r io.ReadSeeker) (float64, error) {
  199. if _, err := r.Seek(0, io.SeekStart); err != nil {
  200. return 0, errors.Wrap(err, "failed to seek webm file")
  201. }
  202. // WebM/Matroska 文件的解析比较复杂
  203. // 这里提供一个简化的实现,读取 EBML 头部
  204. // 对于完整的 WebM 解析,可能需要使用专门的库
  205. // 简单实现:查找 Duration 元素
  206. // WebM Duration 的 Element ID 是 0x4489
  207. // 这是一个简化版本,可能不适用于所有 WebM 文件
  208. buf := make([]byte, 8192)
  209. n, err := r.Read(buf)
  210. if err != nil && err != io.EOF {
  211. return 0, errors.Wrap(err, "failed to read webm file")
  212. }
  213. // 尝试查找 Duration 元素(这是一个简化的方法)
  214. // 实际的 WebM 解析需要完整的 EBML 解析器
  215. // 这里返回错误,建议使用专门的库
  216. if n > 0 {
  217. // 检查 EBML 标识
  218. if len(buf) >= 4 && binary.BigEndian.Uint32(buf[0:4]) == 0x1A45DFA3 {
  219. // 这是一个有效的 EBML 文件
  220. // 但完整解析需要更复杂的逻辑
  221. return 0, errors.New("webm duration parsing requires full EBML parser (consider using ffprobe for webm files)")
  222. }
  223. }
  224. return 0, errors.New("failed to parse webm file")
  225. }
  226. // getAACDuration 解析 AAC (ADTS格式) 文件以获取时长。
  227. // 使用 gomedia 库来解析 AAC ADTS 帧
  228. func getAACDuration(r io.ReadSeeker) (float64, error) {
  229. if _, err := r.Seek(0, io.SeekStart); err != nil {
  230. return 0, errors.Wrap(err, "failed to seek aac file")
  231. }
  232. // 读取整个文件内容
  233. data, err := io.ReadAll(r)
  234. if err != nil {
  235. return 0, errors.Wrap(err, "failed to read aac file")
  236. }
  237. var totalFrames int64
  238. var sampleRate int
  239. // 使用 gomedia 的 SplitAACFrame 函数来分割 AAC 帧
  240. codec.SplitAACFrame(data, func(aac []byte) {
  241. // 解析 ADTS 头部以获取采样率信息
  242. if len(aac) >= 7 {
  243. // 使用 ConvertADTSToASC 来获取音频配置信息
  244. asc, err := codec.ConvertADTSToASC(aac)
  245. if err == nil && sampleRate == 0 {
  246. sampleRate = codec.AACSampleIdxToSample(int(asc.Sample_freq_index))
  247. }
  248. totalFrames++
  249. }
  250. })
  251. if sampleRate == 0 || totalFrames == 0 {
  252. return 0, errors.New("no valid aac frames found")
  253. }
  254. // 每个 AAC ADTS 帧包含 1024 个采样
  255. totalSamples := totalFrames * 1024
  256. duration := float64(totalSamples) / float64(sampleRate)
  257. return duration, nil
  258. }