OpenAI 升级 Whisper 语音转录 AI模型,不牺牲质量速度快 8 倍

OpenAI 在 10 月 1 日举办的 DevDay 活动日中,宣布推出了 Whisper large-v3-turbo 语音转录模型,共有 8.09 亿参数,在质量几乎没有下降的情况下,速度比 large-v3 快 8 倍

Whisper large-v3-turbo 语音转录模型是 large-v3 的优化版本,并且只有 4 层解码器层(Decoder Layers),作为对比 large-v3 共有 32 层。

Whisper large-v3-turbo 语音转录模型共有 8.09 亿参数,比 7.69 亿参数的 medium 模型稍大,不过比 15.5 亿参数的 large 模型小很多。

OpenAI 表示 Whisper large-v3-turbo 的速度比 large 模型快 8 倍,并且所需的 VRAM 为 6GB,而 large 模型需要 10GB。

OpenAI 升级 Whisper 语音转录 AI模型,不牺牲质量速度快 8 倍

Whisper large-v3-turbo 语音转录模型大小为 1.6GB,OpenAI 继续根据 MIT 许可证提供 Whisper(包括代码和模型权重)。

GitHub:https://github.com/openai/whisper/discussions/2363

模型下载:https://huggingface.co/openai/whisper-large-v3-turbo

在线体验:https://huggingface.co/spaces/hf-audio/whisper-large-v3-turbo

声明:内容均采集自公开的网站等各类媒体平台,若收录的内容侵犯了您的权益,请联系邮箱,本站将第一时间处理。
资讯

微软 Copilot 变身新闻主播:时长 4 分钟、4 种语音,AI 网罗热点和用户偏好信息

2024-10-2 11:01:41

资讯

谷歌 DeepMind 携手 BioNTech 打造 AI科学助手:规划实验、预测结果,助力科技变革

2024-10-3 15:49:46

搜索