Final2x - v2.1.0
开源图片无损放大工具
Whisper 是 OpenAI 发布的通用语音识别模型。它能做多语言转写、语言识别和语音翻译,也能在本地电脑或服务器中运行。它更像一套模型与命令行工具,面向普通用户的图形界面需要由其他项目补上。

Whisper 可以把音频转成文字,自动判断语言,也能把多种语言的语音翻译成英文。官方提供从 tiny 到 large 的多种模型,还提供速度更快的 turbo 模型。模型越大,通常识别能力越强,显存和运行时间也会增加。
安装前要准备 Python 和 FFmpeg,再通过 pip 安装 openai-whisper。命令行可以直接指定音频文件与模型。官方列出的显存需求大致从 1 GB 到 10 GB,turbo 模型约需 6 GB。没有独立显卡也能尝试 CPU 推理,只是处理长音频会花更多时间。

它适合生成视频字幕、整理采访录音、转写会议内容和建立音频搜索索引。录音质量、背景噪声、口音和专业术语都会影响结果。重要字幕和公开稿件仍要人工校对,尤其是人名、数字和专有名词。
Whisper 的代码与模型权重采用 MIT 许可证,可免费使用和修改。本地运行没有按分钟计费,成本主要来自设备、存储和计算时间。把它接入在线服务时,还要自行处理上传音频的隐私、授权和保存周期。
当前可核验的最新发行版为 20250625,发布于 2025 年 6 月 26 日。Whisper 的优势是模型成熟、语言覆盖广、生态丰富。安装依赖和命令行操作会抬高普通用户的上手门槛,选择第三方图形界面时也要另外核对其来源。