MOSS-Transcribe-Diarize:本地离线字幕转写 - 上传视频即可转写+加字幕一键完成
MOSS-Transcribe-Diarize 是一个开源的端到端音频理解模型(0.9B 参数),由 OpenMOSS 团队开发。它能一次性把长音频或视频转成带说话人标签和时间戳的结构化文字,并且自带可视化字幕操作界面,支持直接上传视频转写,支持自由手动编辑转写字幕,还能把字幕烧录进视频生成带字幕的 MP4。
它把“听懂谁在什么时候说了什么”和“直接做成带字幕视频”这两件事一起搞定,特别适合需要处理真实长对话和视频内容的场景。
想象你有一段 1 小时的多人会议录音,或是一段访谈视频:几个人轮流说话,有时重叠,背景还有噪音。
传统方法要先转文字、再分离说话人、再对齐时间、最后手动加字幕,步骤多且容易出错。
这个模型直接“听一遍”就输出带说话人编号和时间戳的文字,例如:
欢迎大家
新的转写流水线已经准备好评估了
太好了,把说话人分离结果也写进报告里
现在,你只需要打开软件,上传音频或视频文件,就能:
自动生成带说话人标签的字幕
在线审阅和调整
导出 JSON / SRT / ASS 字幕文件
一键把字幕烧录进视频,生成带硬字幕的 MP4
最最关键的是,整个操作过程完全离线,无任何联网行为,最大限度保护个人隐私。
主要特点
端到端一体:转写 + 说话人分离 + 时间戳 一步完成,一致性更好,不用拼接多个系统。
支持长内容:单次推理最长约 90 分钟音频/视频。
多语言:支持 50+ 种语言。
视频友好:Web UI 直接支持上传视频转写,并可一键烧录字幕到视频。
本地字幕工作流:上传 → 审阅 → 导出字幕或烧录视频,界面支持中英文。
性能领先:在多个真实场景基准上表现优秀,曾在相关国际挑战赛中获第一。
可定制:支持热词提示(专业术语、人名等),也可微调。
应用领域
会议/办公:自动生成带说话人区分的会议纪要,或直接给会议录像加字幕。
播客/访谈/媒体:快速整理多说话人内容,导出字幕或生成带字幕的成片。
视频创作:给视频一键加精确时间戳和说话人字幕,并烧录成最终成片。
教育/讲座:课堂录音/录像转文字,区分老师和学生,方便复习或发布。
客服/通话记录:分析谁在什么时候说了什么,并生成带字幕的回放视频。
内容生产:批量处理长视频,自动出字幕文件或带字幕版本,提升效率。
使用教程:(支持CPU,速度略慢,建议N卡,显存4G起,支持50系显卡)
上传需要转写的音频或视频,点击 开始转写。
等待转写完成,页面会输出转写完成后的字幕列表,并可以拖动音频/视频定位到指定的时间轴,支持修改字幕
修改后(支持对话人物名称、字体大小、字体颜色等设置),点击保存
视频支持将字幕烧录成硬字幕到视频文件,点击烧录,完成后,点击最下方输出区域的 MP4即可保存稍后后带字幕的视频文件
同时支持多种字幕文件格式导出,根据需要下载对应格式字幕文件即可。
下载地址:
迅雷网盘:https://pan.xunlei.com/s/VP0M5XIR2pY2EBNRUQo_XUhjA1?pwd=h7a9
夸克网盘:
**** 本内容需购买 ****
百度网盘:
**** 本内容需购买 ****
之前处理多人会议/访谈,基本都是 Whisper 转写 + pyannote 分离 + 手动对齐,最烦的是说话人标签在长录音里经常漂移,同一个人换一段编号就变了,得花大量时间手工修。这种端到端一次出]文本的结构,如果跨段一致性做得好,能省太多事。
页:
[1]