如何用Transformers把多人会议录音转成文字 如何用Transformers把多人会议录音转成文字【免费下载链接】transformers Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.项目地址: https://gitcode.com/GitHub_Trending/tra/transformersTransformers 的自动语音识别功能能把一段多人混在一条音轨上的会议录音转成文字并用时间戳标出每句话在录音中的位置。想象一下一场三个人开的会录音里你一句我一句你想快速找到“预算”那段讨论从头听完不现实转成文字并带上时间戳后可以直接定位到那几秒。读完本文你可以在自己的录音上跑通这条转写流程并知道两个最影响效果的参数怎么调。 先看效果输入是一段多人同时说话的 WAV 会议录音得到的东西是两部分一段完整文字转写外加一个“时间点 句子”的列表可以顺着列表找到某句话出现在录音的哪一秒。下图里两个人并排干活、声音混在一起的场景就是模型要处理的状态多路人声同处一条音轨。安装与环境准备环境假设Python 3.10Linux 或 macOS。CPU 也能跑有 GPU 会明显快一些。最短路径是两条命令git clone https://gitcode.com/GitHub_Trending/tra/transformers pip install transformers soundfilesoundfile用来读写 WAV 文件transformers提供识别管道本身。如果你只想看官方怎么调 ASR 训练参数语音识别示例目录 里有现成脚本可参考。最小可运行示例下面是全文唯一的核心代码块保存为transcribe.py即可直接运行from transformers import pipeline import soundfile as sf asr pipeline(automatic-speech-recognition, modelopenai/whisper-large-v3) audio, sr sf.read(meeting_3people.wav) out asr(audio, sampling_ratesr, chunk_length_s30, batch_size8, return_timestampsTrue) print(out[text]) for seg in out.get(chunks, []): print(seg[timestamp], seg[text])逐行看它在做什么pipeline(automatic-speech-recognition)把识别模型和音频特征提取器拼成一条即用管道首次运行会自动下载模型权重sf.read读出音频数据audio和它的真实采样率sr两者一起传给管道采样信息才不会丢chunk_length_s30让长录音按 30 秒一段切着喂给模型避免整段一次加载导致显存爆掉return_timestampsTrue给每句附加时间段这是你之后“定位原录音位置”的关键最后循环打印每个分句的时间戳和文字meeting_3people.wav换成你自己的文件即可两个最关键的参数怎么选参数作用建议值chunk_length_s长录音切段长度太短句子容易被拦腰截断太长显存占用高从 15 到 30 之间试普通会议录音取 30 通常稳妥sampling_rate告诉管道“这段音频的真实采样率”传错会导致语速、音调判断异常永远传sf.read返回的sr不要手写其余参数保持默认即可。如果录音明显偏长且机器配置高可以调大batch_size提高吞吐反之就调小。放进真实项目把转写接进你已有的整理流程思路是先拿到带时间戳的句子列表再按关键词扫描命中就打印所在位置。比如for seg in out[chunks]: if 预算 in seg[text]: print(原录音位置(秒):, seg[timestamp][0])验收标准很简单把打印出的时间戳代回原录音播放对应的发言内容和说话顺序应与转写一致能对上说明流程已经可用下一步再把结果导出成带章节的会议纪要。踩坑速查现象转写整句乱码、漏词多。原因两人声音重叠。解法重叠说话是识别里最难的部分预期会差一些尽量用不重叠的片段做验收。现象长录音一跑就显存不足。原因一次性处理整段。解法调小chunk_length_s和batch_size分段喂入。现象听感像变了调时间对不上。原因采样率信息传错。解法把sf.read返回的sr原样传进管道或先把音频重采样到 16kHz 再读。现象第一次运行特别慢。原因在下载模型。解法换个带宽好的机器先跑一次把权重下完之后就走本地缓存。接下来可以做什么如果转写在你的目标语言上不够准可以按 语音识别示例文档 里的流程用自己的标注数据继续微调 Whisper 模型。若在示例脚本里发现 bug按 贡献指南 提交 PR 即可仓库维护者会跟进。【免费下载链接】transformers Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.项目地址: https://gitcode.com/GitHub_Trending/tra/transformers创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

最新新闻

OpenCode 全攻略:3 步在终端里跑通 20+ 编程工具(新手版)

OpenCode 全攻略:3 步在终端里跑通 20+ 编程工具(新手版)

OpenCode 全攻略:3 步在终端里跑通 20 编程工具(新手版) 【免费下载链接】opencode The open source coding agent. 项目地址: https://gitcode.com/GitHub_Trending/openc/opencode OpenCode 是一个跑在终端里的开源 AI 编程代理&…

2026/8/28 10:39:56
AI Agent技能化:从“能聊”到“能用”的工程化实践

AI Agent技能化:从“能聊”到“能用”的工程化实践

读 addyosmani/agent-skills:为什么你的 Agent 总是“能聊不能用” 如果你最近在折腾 AI Agent,大概率经历过这个怪圈:Demo 里聊得挺好,一旦接入真实业务,模型就开始“自由发挥”。让它总结一份周报,它把格…

2026/8/28 10:39:56
Superpowers技能库完整教程:让AI编程Agent按7步流程独立交付一个项目

Superpowers技能库完整教程:让AI编程Agent按7步流程独立交付一个项目

Superpowers技能库完整教程:让AI编程Agent按7步流程独立交付一个项目 【免费下载链接】superpowers An agentic skills framework & software development methodology that works. 项目地址: https://gitcode.com/GitHub_Trending/su/superpowers Super…

2026/8/28 10:39:56
基于PSA Certified的MCU安全Flash存储方案解析

基于PSA Certified的MCU安全Flash存储方案解析

最近一个做智能门锁的朋友找我,说他们的OTA升级出了大问题:设备升级失败自动回滚后,原来存储在Flash里的设备密钥数据全丢了,云端直接拒绝这批设备接入。排查了一天,最后发现根源很简单——他们的MCU把密钥和应用固件放…

2026/8/28 10:39:56
TANCN测试实践:Vitest如何保证代码生成器100%可靠

TANCN测试实践:Vitest如何保证代码生成器100%可靠

TANCN测试实践:Vitest如何保证代码生成器100%可靠 【免费下载链接】tancn Tanstack Builder for Form and Table 项目地址: https://gitcode.com/gh_mirrors/ta/tancn TANCN 是一个基于 TanStack 生态的可视化构建器,能帮你拖拽搭建表单&#xff…

2026/8/28 10:39:56
OpenCV跨平台开发实战:Windows与Linux环境搭建、差异处理与部署指南

OpenCV跨平台开发实战:Windows与Linux环境搭建、差异处理与部署指南

1. 项目概述:跨平台视觉开发的现实挑战与机遇 在计算机视觉和图像处理领域,OpenCV(Open Source Computer Vision Library)无疑是开发者手中的“瑞士军刀”。无论是人脸识别、物体检测,还是简单的图像滤镜,O…

2026/8/28 10:34:56