Cue是一款运行在用户桌面上的语音 AI 智能体。只需按下快捷键并开口说话,无论是任何应用中的语音听写,还是读取屏幕内容、选择合适工具并采取行动的智能体任务,Cue 都可以精确执行。
Cue 想要实现的使命非常简单: 让 AI 成为人们通过语音 (而非打字) 与计算机交互的自然延伸。在 Cue 的愿景中,键盘在日常计算中应该是可选的,而非必需的。这一使命之所以切实可行,正是得益于像Gemma这样的开放模型,这类模型让小型团队也能够完全在用户的本地设备上运行。
润色语音: 平衡真实声音与速度
语音输入并不是直接以文本形式呈现的。它最初只是原始的语音转文本 (STT) 输出流: 其中包含语气词、缺失的标点符号、同音字错误,以及说话者原本打算保留的自我修正。将该数据流转化为干净、高保真的文本,并且速度要快到不中断用户体验,是任何语音优先界面所面临的核心工程难题。
从说话到看到文本之间,只要间隔超过约 500 毫秒,就会让人感觉到延迟,而这种延迟会打破 "语音比打字更快" 的错觉。Cue 之前基于云端的 "润色" 步骤为每次交互增加了 800 至 900 毫秒的延迟。此外,团队测试的其他模型往往存在 "过度编辑" 的问题: 将随意的日常口语润色成正式的书面语,丢弃自我修正,并在这一过程中抹去了说话者的个人风格。团队希望生成的文本读起来像用户自己说的话,而不是像模型生成的。
集成Gemma 4 E4B后,延迟大幅降低了 44%,中位数延迟从 876 毫秒降至 488 毫秒。如今,"润色" 步骤始终能在团队为 "感觉比打字更快" 所设定的感知预算时间内完成。

△ 润色步骤的延迟是在 Apple Silicon (M 系列芯片) 上通过 Ollama 测量的,测试基于包含英语和混合语言输入的 227 个真实语音样本基准。单用户听写使用量是在默认切换前后的四周内,对活跃测试版用户统计而得。数据截至 2026 年 5 月。
Cue 的润色架构设计得非常简单。用户按住快捷键并说话,音频通过云端 STT 被转录为原始文本。然后,该原始文本通过 Ollama 被发送到在用户设备上本地运行的 Gemma 4 模型,并带有一个紧凑的、大约 400 个 Token 的系统提示词,该提示词编码了 Cue 的格式化规则:
恢复标点符号并将数据流分割为句子;
去除语音中的语气助词;
通过理解上下文语境,修正相关的同音字;
根据当前输入框类型调整格式 (例如,对于像 "打开终端" 这样的简短命令末尾不加句号,但对于电子邮件撰写则需要有完整的标点符号)。
润色后的文本随后通过系统的原生 API 粘贴到光标所在位置。
△ 在 Cue 的润色架构中,云端 STT 接收音频并将其转录为文本,随后润色步骤完全在用户的本地机器上运行。
从说话、润色到插入的完整闭环流程在不到一秒内即可完成。对于语音优先的界面来说,这正是导致一个功能是让人感觉 "延迟卡顿" 还是 "瞬间插入" 之间的本质性差别。自这些改进实施以来,Cue 的单用户听写量增加了约 30%。以前仅听写简短消息的用户开始听写更长内容,而通常在时效性要求高的工作中使用打字的用户也选择了利用语音模式。
颠覆架构: 将限制转化为特性
在 Cue 中,每位用户的听写都是无限制的,包括免费用户。随着 Gemma 4 E4B 完全在端侧运行,Cue 润色步骤的边际成本降至零,这使得一项原本可能会被限制次数或付费才能使用的功能,在免费版中也变得可行。
团队最初计划仅将 Gemma 用作离线备用方案,最初的假设是规模更大的模型会提供更高的准确性。但在对涵盖英语和其他语言以及混合语言输入的 227 个真实语音样本运行基准测试后,他们决定将 Gemma 作为文本润色的首选模型。基准测试表明,Gemma 4 恰好具备在不进行 "过度编辑" 的情况下进行格式化和纠错的能力。对于文本润色任务而言,这种特性并非限制,而恰恰是该任务所需的行为。
Cue 的部署仅采用了基础模型配合提示词工程。当前活动应用的上下文 (如应用名称、输入框类型、可用的占位符文本) 会被注入到提示词中,以便模型知道用户是在撰写 Slack 消息或电子邮件还是在输入终端命令。云端路径仍作为备用方案保留: 如果 Ollama 未运行,Cue 的桌面应用会在启动时检测到这一点,并将路由切换至云端模型,从而保证听写功能继续运行而不中断。
这种 "本地 Gemma 为默认,云端为备用" 的架构,正是该团队最初计划的反转,也是目前 Cue 用户进行每一次听写的核心支柱。
Cue 创始人兼 CEO Eli Li:“我们原本预期 Gemma 只是离线模式下的备用方案。但对真实的语音样本运行基准测试后,架构得到了巨大的反转 —— 现在 Gemma 是默认的润色方案,而云端模型则成为了备用方案。我们原本以为是缺点的 '限制',最终证明恰恰是这项任务所需要的。”
引领设备端语音智能体的未来
虽然 Gemma 目前只负责润色,但团队正在将其应用范围扩展到两个相邻领域:
第一个是记忆:一个持久化的本地层,可以跨会话 (Across Sessions) 学习每个用户的说话风格、词汇和格式偏好。这使得 Cue 的输出能够适应用户,而不是强加单一的预设风格。
第二个是智能体路径:尽管 Cue 的智能体模式目前仍依赖云端模型,但早期的评估显示,Gemma 4 的原生函数调用 (Function Calling) 功能 —— 通过 Ollama 的 tools API 直接提供,无需提示词工程中转 —— 可以成功地在本地处理相当一部分独立任务。
为了评估数百个真实语音样本中的润色延迟、保真度和质量,团队构建了一套确定性、可复现的基准测试套件,并计划与开发者社区分享其评估方法。通过开源其评估框架,其他构建语音优先或本地优先 AI 的团队也可以在自身的工作负载上运行同样结构化的本地与云端对比。
团队认为,更深层次的启示在于,本地与云端之间的差距缩小速度远超大多数产品团队的想象。而要了解您的任务究竟处于这条分界线的哪一侧,唯一的办法就是基于真实数据进行测量。对于 Cue 来说,这种测量得出了一个明确的答案: 在用户每次开口说话都会运行的这一工作负载上,Gemma 4 就是最合适的模型。
即刻探索端侧 AI,开启您的Gemma开发之旅,打造极具影响力的精彩应用吧。也欢迎您持续关注 "谷歌开发者" 微信公众号,及时了解更多开发技术和产品更新等资讯动态。
- 随机文章
- 热门文章
- 热评文章
- “便民办税春风行动”再起航 三方面发力吹暖经营主体
- 中国电信19亿元控股国盾量子 加速“掘金”量子科技
- 热潮涌动的人工智能距离科技“奇点”还有多远
- 新研究:南极冰盖表面珍贵陨石正迅速“消失”
- 投资者惊呼!这几国要联手干预汇市?后市展望如何?
- 中央汇金再次大买3只ETF?买入金额至少近1400亿元
- 创纪录水平!日元空头头寸暗示日元大幅反弹的可能性增加
- 白条猪肉:需求相对弱势,4月东北猪肉行情缓跌为主
- “特种兵椰汁”商标认定无效 最高检:商标不得损害国家和社会公共利益
- 全球债市焦点:日本维持购债,美国通胀粘性,投资者何去何从?
- 破罐子破摔?日本央行维持利率不变,美元兑日元暴涨再创逾30年新高
- 大悦城发布2023年财报:净利润扭亏,多元业务引领稳健经营
- 上海农商行2023年营收、归母净利实现双增长
- 1“赛事+”提升城市“流量” 陕西商洛拓经济发展新“赛道”
- 2“五一”临近 持基过节的投资者要注意这几点
- 3华发股份:成功入选“人民优选”品牌 五一黄金周热销30亿
- 4到2027年产业规模达到2000亿元 浙江发布历史经典产业高质量发展计划
- 5钟鼓楼老街区的古都新事
- 6非常危险!女子摔成粉碎性骨折!又是因为洞洞鞋,夏天多人中招……
- 7金税四期试点上线,财税体制改革拉开帷幕!或有资金借道信创ETF基金(562030)逢跌进场布局
- 8IDC:24Q1全球PC出货量恢复增长 达到疫情前水平
- 9初步数据:我国一季度经常账户顺差392亿美元
- 10“发现山西之美”TDC旅游发现者大会举办:共话文旅新生态 邀客体验新玩法
- 11国门“夫妻档” 国庆共坚守
- 12北交所一周审核动态:2家企业更新进展 胜业电气二轮问询回复中称家电头部客户对价格敏感度较低
- 13甘肃白银县域经济:从“一枝独秀”到“多点开花”
- 1大裁员下,特斯拉两名顶级高管离职
- 2奇瑞将与欧洲高端品牌签署技术平台授权协议
- 32024中国长三角青年企业家交流大会在杭州举办
- 4雷克萨斯GX中东版 全部在售 2023款 2022款 2020款 2019款 2018款成都远卓名车雷克萨斯GX中东版团购钜惠20万 欢迎上门试驾
- 5零跑C16将搭载中创新航磷酸铁锂电池
- 6Q1净利微增7%,宁德时代股东总数较2023年年末减少10728户
- 7哪吒,需要背水一战
- 8“新”中有“机”!创新服务承接新流量 撬动消费升级
- 9非创始版SU7何时交付 小米:工厂生产爬坡 全力提高产能
- 10央媒评卧铺挂帘:谁买的票谁做主
- 11江西南昌首部“多规合一”国土空间总体规划获批
- 12方程豹旗舰硬派越野!豹8正式亮相:仰望U8“青春版”登场
- 13583家族/造型霸气 方程豹豹8量产版发布




