
1. 项目简介 本项目是基于阿里 Qwen3-ASR 系列大模型构建的深度增强版离线语音处理工具。通过高度模块化的架构重构,解决了原生模型推理代码处理超长音频限制,没有说话人识别模块等短板。它不仅是一个转写工具,更是一个集**“语音转文本、角色分离、精准时间轴对齐、热词注入”**于一体的生产力工具。 2. 核心亮点 🚀 突破时长限制:通过高精度物理切片算法,自动将超长音频按分段处理并无缝合并,彻底解决官方模型单次 20 分钟的处理限制。 👥 顶级角色识别:离线集成最新的 Pyannote Community-1 说话人分离模型,识别精度大大超越上一版的Cam++。在多人对话中精准锁定身份,并一键导出全员及独立角色的 SRT 字幕。 ⚖️ 零漂移时间轴:采用“物理基准+字符级核销”算法,确保字幕时间轴即使在处理长音频或用户大幅修改文本后,依然精准锚定。 📏 精准文稿对齐:支持“文本驱动”模式,用户提供文字,系统自动匹配音频生成精准 SRT,并支持按照标点符号和字数限制自动美化断句。 ⌨️ 热词提示注入:支持通过提示词方式(qwen3asr基于llm,能结合上下文理解) 注入背景知识,显著提升专业术语、专有名词的识别率。 🛡️ 纯净离线环境:全模块化绿色包设计,不联网、不上传数据,不泄露隐私,内网用户也可以跑啦。 3. 硬件需求 本懒人包仅支持使用配备 NVIDIA 显卡的设备。本项目提供两个版本: 【0.6B 极速版】 特点:推理速度极快,显存占用友好。 建议显存:6GB 及以上。 适用场景:日常会议、短视频、配置一般的笔记本。 【1.7B 高精版】 特点:目前开源界最强的 ASR 性能,语感极佳,标点和语气识别更精准。 建议显存:8GB 及以上(推荐 16GB 显卡以获得最佳切片处理性能)。 适用场景:专业影视字幕、复杂环境录音、高质量文献转录。 4. 简单使用说明 启动:双击根目录下的 一键启动WebUI.bat。 界面:浏览器会自动打开 127.0.0.1:7867 页面,包含三个功能标签: 🎯 单音频识别:支持波形预览和在线裁剪,适合快速处理。 📦 批量识别:上传多个文件,后台排队处理,自动打包 ZIP 结果。 📏 精准对齐:贴入已有文稿,系统自动为文字匹配时间轴。 获取结果:处理完成后,结果将保存在根目录的 outputs 文件夹中。 5. 致敬开源 本懒人包的成功运行离不开以下开源社区的卓越贡献,特此致敬: Alibaba Qwen Team:提供了强大的 Qwen3-ASR 及 Forced-Aligner 基础模型。 Pyannote.audio:提供了业界领先的说话人分离算法(Community-1)。 ModelScope:提供了便捷的模型托管与分发平台。 Gradio:提供了优雅的 Web 交互界面框架。 FFmpeg:提供了坚如磐石的底层音视频处理支持。
下载地址:https://pan.baidu.com/s/1vvvnCoT0LAv5stTQKWp8QQ?pwd=lijj
- 百度网盘