开源 · 本地优先 · v0.3.0 已发布

顺口一说,
即刻上屏。

按住 fn 说话,整理好的文字直接落在光标处;按 fn + 左 ⇧ 说中文,出来的是英文。识别默认在本机离线完成。

macOS 13+ Apple 芯片 · 另有 Windows x64 · MIT 许可证 · 基于 Handy

# 官网改版
小

官网的首页草稿放群里了,大家看看?

M

动效挺好,下载按钮再显眼一点。

发消息到 #官网改版

演示为脚本回放,不会使用你的麦克风。录音时按 Esc 取消。

Qwen3-ASR 0.6B本地识别推荐SenseVoice本地识别Whisper本地识别阶跃星辰 StepAudio云端识别阿里云百炼 Qwen-ASR云端识别智谱 GLM-ASR云端识别DeepSeek文本模型默认阿里云百炼文本模型OpenAI 兼容接口文本模型Apple Intelligence文本模型
Features

说话的速度,打字的精度

口述、翻译、整理和词典,目的都是让你说完以后,光标处的文字可以直接发出去。

01
fn

按住 Fn,说完就上屏

短按开始、再按结束,或者按住说、松开结束。文字直接落在光标所在的输入框,任何应用都能用。

02
下周一上线,请提前测一下Ships Monday — please test early.

说中文,出来是英文

Fn + 左 Shift 进入翻译。目标语言在悬浮条上随时切换,18 种语言可选;口述中途加上 Shift 也能转成翻译。

03

不抢焦点的黑色胶囊

录音时屏幕底部只有一个小胶囊:✕ 取消、实时波形、✓ 完成。你正在打字的窗口始终保持焦点。

04

嗯那个我们明天就是三点开会

口头语自动去掉

文本模型把「嗯、那个、就是」理顺成书面表达,不改变意思。也可以只纠错,或者完全关掉。

05
deep seek→DeepSeek

专有名词一次教会

把产品名、人名、术语和它们常被听错的样子写进词典。识别后按字面替换,翻译时用固定译法。

06
本地识别云端识别

本地或云端,自己选

默认用 Qwen3-ASR 在本机离线识别,30 种语言自动判断语种。需要时再切到阶跃星辰、阿里云百炼或智谱的云端识别。

Try it

不用安装,先在网页上点一点

下面是照客户端界面一比一重建的顺口说主窗口,可以切页面、拨开关、改快捷键、下载模型、加词条。

首页

顺口一说,即刻上屏。

按住快捷键说话,文字会直接落到光标所在的位置。

本周输入1,813
你的说话速度212字 / 分钟
比打字快430%
语音输入
按下开始和停止语音输入。
翻译
按下开始和停止翻译。
触发方式
短按一次开始、再按一次结束;或按住说话、松开结束。

录音时:按 Esc 或点 ✕ 取消,点 ✓ 结束。先按住 Fn 再按左 Shift,会把正在进行的口述切换为翻译。

Fn 键只在 Apple 键盘上有效。使用第三方键盘时,请改用其他快捷键。

这是用网页重建的客户端界面,所有改动只保存在你的浏览器里。
Privacy

你的声音和文字去了哪儿

下图按三种常见配置,画出哪些数据会离开你的电脑。橙色的线表示数据穿过了网络边界。

这台 Mac网络边界网络上的服务音频识别结果直接插入上传音频识别结果文字 + 命中词条整理后的文字麦克风按住 Fn本地识别Qwen3-ASR词典替换按字面替换落到光标处粘贴云端识别ASR 服务商文本模型整理 / 翻译
音频在本机识别;只有识别出的文字和命中的词条会发给你配置的文本模型。
  • 音频 不出本机
  • 文字 识别结果和命中的词条
  • 出错时 整理失败就插入识别原文,词典替换已经应用。
Open source

开源,也打算一直开源

从 Handy 分叉而来

顺口说从开源项目 Handy(MIT)分叉。录音、全局热键、不抢焦点的悬浮窗、可靠粘贴和模型管理沿用上游;翻译模式、文本模型整理、词典和云端识别是新加的。

  • Tauri 2 + Rust 后端,React 前端
  • 本地识别不联网,失败时不会悄悄改用云端
  • 在「设置 → 关于」里检查新版本,覆盖安装不用重新授权
# 克隆并在本地运行 $ git clone https://github.com/zuijiaosy/sayso.git $ cd sayso && bun install $ bun run tauri dev # 下载安装包后去掉隔离属性 $ xattr -cr /Applications/Sayso.app
FAQ

常见问题

按 Fn 时会切换输入法或弹出表情面板

打开「系统设置 → 键盘」,把「按下 🌐 键时」改成「不执行任何操作」。顺口说的首页会检测这项设置,不对时会给出提示。

我的声音会上传吗?

默认不会。本地识别用 Qwen3-ASR 0.6B 在本机离线运行,音频不离开这台 Mac。只有在「模型 → 语音识别」里主动切到云端识别时,音频才会上传到你选择的服务商。

本地识别失败时不会悄悄改用云端。

文本模型会拿到什么?

开启口述整理或使用翻译时,识别出的文字和命中的词典词条会发给你配置的文本模型(默认 DeepSeek deepseek-flash,也可以用阿里云百炼或任意 OpenAI 兼容接口)。把口述整理设为「关闭」且不用翻译,文字就不出本机。

不配置 API Key 能用吗?

能。用本地识别并关闭整理,就是完全离线的用法,口述会直接插入识别结果(仍会应用词典替换)。翻译需要文本模型。

全部问题 →