V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  retemlamb  ›  全部回复第 1 页 / 共 3 页
回复总数  55
1  2  3  
@sickworm 坦率地说,目前听写功能只做了热词,还没有加基于 LLM 的文字后处理,目前无法完全替代 typeless ,后续会加强这方面的内容,感谢支持
@ethusdt 太棒了,直接把 xcframework 接进自己的 App 里,这正是我们希望看到的用法!

回你的三个问题:

1. Metal 后端支持在计划中,目前 macOS 桌面端已经用上了 Metal 加速,iOS 的 xcframework 还是 CPU ,后续会加上(预计下周)
2. FireRedVAD 目前确实只在桌面端/CLI 里用了,xcframework 没有暴露。你用的能量 VAD 方案作为轻量替代是合理的,后续会把 VAD 也作为 SDK 能力开放
3. 你说得对,目前推理过程中没有接 ggml 的 abort callback ,停止时要等当前计算图跑完才能释放。这个确实该补上
@ccvip 感谢二次支持,你走过的路正好就是 OpenASR 想解决的问题。

你提的三个需求都很实在:

1. 批量转写保持目录结构——CLI 的 openasr transcribe 已经支持指定输入目录 + -o 输出目录,输出文件名跟输入一致只换扩展名(目前可以让 agents 来做)。桌面端的批量导入在做了
2. 输出格式目前支持 txt/json/srt/vtt/markdown ,说话人分离/声纹识别预计周内上线,热词目前支持(后续会考虑增增加热词配置文件)。meta 摘要还没有,跟第 3 点一起规划
3. 转写后接 LLM 做总结/润色确实是下一步方向,配置 prompt 模板自动出总结这个思路很好,之前有考虑过,目前可能排期可能会到 1-2 周后(目前仍在优化基础体验,提升模型的运行速度,接入新模型等)

商业化的建议也收到,目前暂无精力做云版本,待功能完善后,可能会出一些企业产品,感谢!
@justxwy 可能是的,因为模型都托管在 hf 上,高级设置中有“国内加速”的选项,打开后会好很多
@Kobayashi #107 感谢推荐,刚认真看了一下,确实有不少重叠。侧重点不太一样:TypeWhisper 更偏听写 + AI 工作流,通过插件组合本地和云端模型; OpenASR 更偏统一的本地推理引擎和模型生态,重点在多架构模型统一运行、长音频字幕、说话人分离和中文方言上。两者也不冲突,TypeWhisper 完全可以通过本地 API 把 OpenASR 当模型后端用
0.1.19 桌面版(内核 0.1.23 )更新了

更新日志:
- 修复启动后偶尔卡死 — 系统托盘菜单更新时存在一个死锁,已排除。特别感谢 @zealotxxxx 提供的日志分析
- GPU 内核切换失败时给出明确原因 — 例如切换到 CUDA 失败,现在会告诉你具体哪一步出了问题,日志里也能查到详情;不再只显示含糊的"本地文件错误"。
- 双显卡电脑正确识别独显 — 集显+独显并存时,现在能正确找到 NVIDIA 或 AMD 独立显卡并优先使用,不会再用错卡。
- Windows 深层路径不再报错 — 路径超出系统默认长度限制时,模型目录迁移、引擎内核安装等操作现在都能正常完成。
- 直接转写微信/Telegram 语音 — 新增 Opus 、WebM 、无损 M4A 格式支持,不用再手动转格式。
- 显存不够时自动降级到 CPU — 遇到显存不足,会自动回退用 CPU 跑完,不再整个任务直接失败。特别感谢 @tushile928 提供的日志分析
- FireRed 系列转写更快 — 引擎层面的速度优化。速度提升至前一版本 2-6 倍。 @ccvip 可以试试这个版本,速度快了很多
@aaxx2xx #97 好的,稍后我会专门优化解决断句的问题,断句确实是当前最大的痛点之一,后续会做针对字幕的专门优化工作,确保断句/换行等合理,这个场景会重点优化
@undefine2020 #95 好的,用手机连接把通话转到电脑上走系统音频,这样就是数字流了,识别效果会好很多。期待你的使用反馈!
@zealotxxxx #94 96 非常感谢,刚刚在 github 上看到了,非常详细和有用,目前这个问题已经修复,将随下一个版本在今天中午发布
@exmorning #93 方便到 https://github.com/QuintinShaw/openasr/issues 提一个 issue 吗?把崩溃信息和 daemon.log 贴上来(高级设置 → 打开日志文件夹),我帮你排查。或者也可以等今天中午时段新版本,新的 0.1.19 版本还在走发布流程(部分内核编译需要一个半小时左右)
@4641585 #92 批量转换应该这周内会上线桌面端。WAV 一开始就是原生支持的。目前支持格式如下,供参考:

- WAV 无损未压缩录音,最常见的原始录音格式
- MP3 通用有损音频,播客/音乐/录音笔常用
- FLAC 无损压缩音频
- M4A (AAC) 苹果设备录音、语音备忘录的默认格式
- M4A (ALAC) 苹果无损音频
- MP4 视频文件,自动抽取音轨转写
- WebM 网页视频/录屏(Vorbis 或 Opus 音轨),自动抽取音轨
- OGG 开源容器(Vorbis 或 Opus 音轨)
- OPUS 微信、Telegram 、WhatsApp 等聊天软件的语音消息格式
- QTA QQ 语音导出格式
@sayno #91 感谢 star !说话人分离录音转写已经支持了,桌面端预计本周内上线。会议录音这个场景是重点
@nicenan #89 声纹匹配已经接了 WeSpeaker 模型,配合说话人分离用。预计本周内会上线到桌面端
@jawilx #88 支持的,直接拖视频文件进去就行,支持导出 SRT/VTT 字幕格式
@sweeyeah #82 录屏用的 Screen Studio ,一个专门的录屏工具,自动跟随鼠标放大和平滑动画,拍产品演示很方便。很多 UP 主/Youtuber 都在用,https://screen.studio
@Admstor #79 翻译确实在计划中,方向是转写后接本地 LLM 做文本翻译和润色。实时字幕叠翻译的难点主要在延迟——两个模型串行跑,体验容易卡(两个模型同时抢占 CPU/GPU/内存带宽),还在探索怎么做到流畅
@aaxx2xx #78 剪映用的是云端 ASR(火山引擎) + 专门的字幕断句后处理:先转写,再用独立的语义切分做字幕级断行(控制每行长度、在语义边界切),所以断句是它的独立优化项。我们目前输出的是模型原生断句,还没有加字幕化后处理这一层——这层已在计划里(本地断句/标点后处理,不走云),会作为后续版本的重点。短期如果你是导出字幕用,可以先在剪辑工具里用“按标点重新分行”过一道,或者让 LLM 处理
@aosan926 #69 我之前在英国时读书也这样,身边一些同学/老师口音很重
@zealotxxxx #67 macOS 27 beta 的兼容性问题我需要排查一下,方便的话到 https://github.com/QuintinShaw/openasr/issues 提一个 issue ,把报错信息和 daemon.log 贴上来(高级设置 → 打开日志文件夹)。局域网转码服务在计划中,目前的架构是完全支持的,目前还在优化使用上的基础体验,稍后会更新这部分内容(笔记本/手机都可以使用其他的电脑作为计算设备)
@111111111111 @yiranw09 桌面版 0.1.18 版本已经发布,感谢你们的反馈,目前 Intel 显卡的依赖问题已经彻底解决,可以把计算设置切回“自动”了,目前 I 卡应该可以正常使用了,如果有任何问题,欢迎你们给我再次反馈
1  2  3  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2736 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 13ms · UTC 13:07 · PVG 21:07 · LAX 06:07 · JFK 09:07
♥ Do have faith in what you're doing.