转录.cpp
真正值得关注的不是这条新闻本身,而是它可能把「AI」的竞争焦点推向模型能力与产品控制权的竞争。
原文链接:https://workshop.cjpais.com/projects/transcribe-cpp
我非常高兴今天能分享 transcribe.cpp。
transcribe.cpp 是一个基于 ggml 的转录库,支持所有最新的转录模型。已经过数值验证和 WER 测试,以匹配参考实现。到处都在加速。摆脱向许多人分发跨平台语音到文本应用程序的痛苦。无法独自发现!请报告它们,让我们一起修复它们!方便快捷,但仅靠 CPU 就无法发挥太多性能。留给我的问题多于答案。关于绑定以便您可以在真正的桌面或移动应用程序中实际使用它?参考实现。推理应在 GPU 上运行以获得最佳性能。它应该可以简单地嵌入到 Handy 中,它不能是一个巨大的 pytorch 库。您将获得快速、准确的推理引擎以及广泛的模型支持。我们打算支持尽可能多的最先进的转录模型。截至今天,我们支持大多数公开可用的现代转录模型。还有一些缺失,但很快就会添加。准确且尽可能接近参考实现。我们的做法是正确的,我们对每个模型与参考进行了数值验证。与非常流行的 .bin 文件一起运行,并随 Handy 一起提供。认为相当代表人们将在哪里使用图书馆。他们愿意承担这样做的维护负担。当然,归根结底,很多决定都是由 Handy 推动的。维护开源项目并尽我所能为生态系统做出贡献。可以免费为图书馆做出贡献!
transcribe.cpp 的直接目标是使本地运行的 ASR 更容易。我们知道转录可以极其准确地运行,通过 transcribe.cpp 在其贫乏的 CPU 上比实时运行模型更快。
SOTA 模型的转录速度比实时转录更快,功耗仅为几瓦。这不是希望或梦想,而是事实。出于某种原因。这使得发行故事成为焦点。为了让更多的应用程序在本地运行推理,我们需要使运行推理变得更容易。但我希望这是向前迈出的一小步。我当然学到了很多东西。我非常感谢所有支持这个项目的人们。他们的 BiR 程序,以及来自 Mozilla AI 的 Davide。