让语音模型承担识别。
本地与云端转写共用接口,支持指定语言或自动识别。不同引擎的结果进入同一套阅读与回听流程。
VOX / 高性能语音平台
一段声音,从输入到用上,完成得怎么样?
识别得准,让一次投入产生更多价值,并更快用上结果。
01 / ACCURACY · 准确率
从模型、输入和时间戳三个环节,
让文字与真实声音保持联系。
本地与云端转写共用接口,支持指定语言或自动识别。不同引擎的结果进入同一套阅读与回听流程。
ffmpeg 统一采样率与声道,减少输入格式差异造成的处理问题,让录音与视频都能进入流程。
本地转写读取真实 segment 时间;云端逐词时间合并为句段。用户点击正文,可以回到原声核对。
02 / PRODUCTIVITY · 效率
录音可先试听,确认后提交。
后台自动衔接转码与转写。
浏览、复制,理解内容。
按句找到原声与上下文。
英文词汇提取与释义。
把文字和带时间戳的字幕带走。
下次找回,继续阅读与回听。
原始文件与结果关联保存。按名称或 ID 找回,让同一份输入服务下一次学习和工作;不再需要时,也可以管理和删除。
03 / SPEED · 速度
从传输、排队到计算,
把等待拆开,才能针对瓶颈优化。
独立队列与消费者,让短任务无需与长转写争用同一队列。转码与存储仍是共享环节,阈值可配置。
本地模型在 worker 启动时加载,后续任务复用。镜像默认 Tiny,通过 MODEL_PATH 可换模型,按质量与耗时选择配置。
模型的速度与准确率取舍 ↗长音频在本地处理,减少长录音的云端调用量。哪类任务积压,就增加哪类 worker;同时评估本地资源与总成本。
媒体字节不绕经 API 网关。前端分别加载播放器、转写稿与生词,已就绪的内容可以先用,点击句子就能回听。
从 EFFICIENT GO 得到的启发
设计灵感来自 Bartłomiej Płotka 的 《Efficient Go: Data-Driven Performance Optimization》↗。把性能落到可观察的目标上,再寻找值得优化的环节。
Vox 用 Accuracy × Productivity × Speed 表达产品目标:识别质量、产出与投入、端到端耗时。架构服务于这些目标,Git 历史记录每一步选择。
公式表达三者共同影响体验;具体评估分别记录字词错误率、使用投入与处理时延。
从第一段录音,到完整的平台
沿着真实提交,看模型、服务拆分、队列和学习体验怎样一步步长出来。