一个简单的本地语音识别服务 - V2EX

首页注册登录

V2EX = way to explore

V2EX 是一个关于分享和探索的地方

现在注册

已注册用户请登录

爱意满满的作品展示区。

这是一个创建于 802 天前的主题，其中的信息可能已经有所发展或是发生改变。

基于 openai-whipser 开源模型和 flask ，搭建的本地离线运行的语音识别服务，主要自用用于取代百度语音识别的。

GitHub: https://github.com/jianchang512/stt

这是一个离线运行的本地语音识别转文字工具，基于 openai-whipser 开源模型，可将视频/音频中的人类声音识别并转为文字，可输出 json 格式、srt 字幕带时间戳格式、纯文字格式。可用于自行部署后替代 openai 的语音识别接口或百度语音识别等，准确率基本等同 openai 官方 api 接口。

10 条回复 • 2024-11-28 02:00:58 +08:00

1

lloovve

2024 年 1 月 2 日 via iPhone

识别效果如何？能在 linux 下部署么

2

kkstart

2024 年 1 月 2 日

赞，效果如何？

3

tqyq88

2024 年 1 月 2 日

1

https://github.com/SYSTRAN/faster-whisper 这个性能吊打 openai 原生的

4

eatgrass

2024 年 1 月 2 日

https://huggingface.co/spaces/Xenova/whisper-web
直接浏览器里运行，0 部署

5

JNian

2024 年 1 月 2 日

请问作者有没有考虑增加 diarization 功能

6

buyno1

2024 年 3 月 22 日

对 windows 版本有什么要求？电脑配图有什么要求

7

buyno1

2024 年 3 月 23 日

@tqyq88 colab 有没有平替的用来你说这个部署

8

buyno1

2024 年 3 月 23 日

@eatgrass 用 19 秒的 mp3 试了报错

9

chopin1998519

2024 年 8 月 15 日

我偷懒直接用 https://github.com/collabora/WhisperLive

10

WizardLeo

2024 年 11 月 28 日

@eatgrass 有点强，这个真好用

关于 · 帮助文档 · 自助推广系统 · 博客 · API · FAQ · Solana · 2817 人在线 最高记录 6679 ·

Select Language

创意工作者们的社区

World is powered by solitude

VERSION: 3.9.8.5 · 28ms · UTC 10:03 · PVG 18:03 · LAX 03:03 · JFK 06:03
♥ Do have faith in what you're doing.