VoxPERFORMANCE BY DESIGN 进入工作台 ↗

VOX / 高性能语音平台

一段声音,从输入到用上,完成得怎么样?

性能PERFORMANCE准确率ACCURACY效率PRODUCTIVITY速度SPEED

识别得准,让一次投入产生更多价值,并更快用上结果。

01 / ACCURACY · 准确率

识别能力有来源,
关键内容可核对。

从模型、输入和时间戳三个环节,
让文字与真实声音保持联系。

音频 / 视频 → 16 kHz 单声道 WAV
云端识别ElevenLabsScribe v2
本地识别Whisperwhisper.cpp
统一结果 正文 + 段落时间戳
原始声音↔按句回听↔转写正文
01

让语音模型承担识别。

本地与云端转写共用接口,支持指定语言或自动识别。不同引擎的结果进入同一套阅读与回听流程。

02

把媒体准备好,再交给模型。

ffmpeg 统一采样率与声道,减少输入格式差异造成的处理问题,让录音与视频都能进入流程。

03

时间戳要能真正定位到那句话。

本地转写读取真实 segment 时间;云端逐词时间合并为句段。用户点击正文,可以回到原声核对。

02 / PRODUCTIVITY · 效率

一次输入,
产出可以反复使用。

Productivity有效产出 ÷ 用户投入少整理、少切换、少重复处理。
INPUT录制 / 上传

录音可先试听,确认后提交。
后台自动衔接转码与转写。

01

转写稿

浏览、复制,理解内容。

02

定位回听

按句找到原声与上下文。

03

生词候选

英文词汇提取与释义。

04

TXT / SRT

把文字和带时间戳的字幕带走。

05

历史内容库

下次找回,继续阅读与回听。

↺

原始文件与结果关联保存。按名称或 ID 找回,让同一份输入服务下一次学习和工作;不再需要时,也可以管理和删除。

03 / SPEED · 速度

不同的任务,
走适合它们的处理路径。

从传输、排队到计算,
把等待拆开,才能针对瓶颈优化。

共同准备上传 → 转码标准音轨 · 按时长分流
≤ 10 分钟
短转写队列transcribe-short
→
云端 workerElevenLabs · Scribe v2
> 10 分钟
长转写队列transcribe-long
→
本地 workerwhisper.cpp
01 / 排队

让长短转写分别排队。

独立队列与消费者,让短任务无需与长转写争用同一队列。转码与存储仍是共享环节,阈值可配置。

02 / 模型与计算

模型常驻,轻量起步。

本地模型在 worker 启动时加载,后续任务复用。镜像默认 Tiny,通过 MODEL_PATH 可换模型,按质量与耗时选择配置。

模型的速度与准确率取舍 ↗
03 / 资源与成本

云端与本地分工,控制调用量。

长音频在本地处理,减少长录音的云端调用量。哪类任务积压,就增加哪类 worker;同时评估本地资源与总成本。

04 / 传输与使用

文件直达存储,结果独立加载。

媒体字节不绕经 API 网关。前端分别加载播放器、转写稿与生词,已就绪的内容可以先用,点击句子就能回听。

从 EFFICIENT GO 得到的启发

先定义目标,
再用数据检验设计。

设计灵感来自 Bartłomiej Płotka 的 《Efficient Go: Data-Driven Performance Optimization》↗。把性能落到可观察的目标上,再寻找值得优化的环节。

Vox 用 Accuracy × Productivity × Speed 表达产品目标:识别质量、产出与投入、端到端耗时。架构服务于这些目标,Git 历史记录每一步选择。

公式表达三者共同影响体验;具体评估分别记录字词错误率、使用投入与处理时延。

从第一段录音,到完整的平台

每一项能力,都有它的来路。

沿着真实提交,看模型、服务拆分、队列和学习体验怎样一步步长出来。

查看演进路线 →