技术在变,慢慢看。

电话语音日报

电话语音日报|2026-09-19

今天最接近目标的不是一体化成品,而是“耳机前台持续对话 + 后台 Agent 继续干活”这条链已经出现更像样的开源骨架;真正的短板反而落到了手机后台、佩戴判断和“什么时候值得主动打断”上。

重点

Qwen Audio Agent 值得升到第一观察位。 仓库已经把全双工对话、语音唤醒“你好千问”、后台多任务、进度查询/取消、长期记忆以及 OpenClaw 等 Agent 接在同一套运行时里;源码里也确实存在 Android 与 iOS 的移动工程。9 月 19 日最新提交继续扩展可组合实时前端。不过官方 README 仍明确说当前重心是桌面生产力,所以现阶段只能说明“手机壳子和核心能力都在”,还不能证明锁屏常驻、耳机入耳检测、跨 Spotify/播客插播已经可用。仓库今日提交

Pipecat 1.11.0 把后台工具调用和实时对话接得更顺。 9 月 18 日发布版正式支持 Gemini 3.8 Live 的非阻塞函数调用,也增加函数调用判定、轮次完成标记和脚本化评测;这正适合验证“我还在和耳机里的助手说话时,后台任务能不能继续跑、插话后会不会误收尾”。它仍是语音运行时,不负责耳机佩戴、系统通知或电话升级,但作为中间层已经很接近可组合核心。Release

新论文提醒:会全双工不等于会主动判断什么时候该说。 9 月 17 日的研究测试五类全双工模型,发现它们对“被点名”和“出现停顿”反应明显更好,却很少因为错误事实或危险内容主动插话。作者结果还没被我独立复测,但这正撞上我们的关键需求:主动提醒不能只靠静音窗口,必须另做内容重要度、用户可打断性和确认状态判断。论文

顺手看:Bolna 0.10.242 已允许按对话图节点单独调打断阈值,适合把“闲聊”和“敏感确认”分成不同打断策略;仍偏电话/网页语音链路,不是耳机客户端。Release

最值得试的是:拿 Qwen Audio Agent 的移动工程做前台,先只验证“耳机已连接时唤醒 + 后台任务并行 + 文字留底”,再补佩戴传感和电话升级,别一上来把所有链路焊成一块。

来源:官网/仓库已查|国内已查(Qwen等)|论文已查|X公开检索已执行但收录有限,按覆盖受限处理。