技术在变,慢慢看。

电话语音日报

电话语音日报|2026-09-16

今天最值得注意的不是又多了一个“会说话”的模型,而是耳机主入口需要的几块零件已经能找到相当具体的实现:佩戴状态、播放控制、唤醒与长任务、真实电话兜底都有现成项目可拆,但还没有看到一个项目把它们在手机上完整串成你描述的成品。

CAPod 是这次最贴近“戴着耳机才主动插入”的零件。 这个开源 Android AirPods 伴侣能读取入耳状态,并在摘下/戴上时自动暂停或恢复播放;9 月 11 日又发布了 5.2.6-rc0。它本身不是 Agent,也没有语音插播,但证明 Android 侧可以把“蓝牙已连”进一步细分到“耳机实际在耳朵里”,而不是拿连接状态冒充人在听。个人可以直接看源码或安装 APK。 代码 · Release 09-11

Personal Jarvis 把另一半链路拼得很完整。 其仓库 9 月 12 日仍有提交,README 明确包含唤醒词、实时语音、文字聊天共用同一“大脑”、可持续数分钟的独立 Agent、跨会话知识记忆,以及可选 Twilio 真实外呼;项目方还称这些不是路线图。它很适合验证“先语音下任务,后台继续做,必要时电话找人”的控制面,但目前核心形态是 Windows/macOS/Linux 桌面或无头服务器,不是手机耳机 App,也没有入耳检测与跨音乐 App 插播。 仓库 · 09-12 提交

国内移动端语音层也有一块可直接利用的基线。 阿里云百炼 Realtime 官方文档给出 Android、iOS、HarmonyOS 的移动端 AOQ 接入,内置回声消除和降噪,实时模型支持 Function Calling;这能补手机端连续对话、工具调用和弱网链路,但官方资料并没有证明它能判断耳机是否佩戴、跨第三方播放器自动压低音乐,或在未确认后自行升级到普通电话。我的判断是,它更像“耳机助手的语音引擎”,不是完整产品。 Realtime · 语音模型

补一条交互研究基线:9 月 6 日发表的人因研究把开放式耳机视为“环境界面”,重点讨论持续佩戴下的情境感知和社交可接受性。它不提供 Agent 代码,但提醒主动插播不能只看“耳机戴着”,还要判断用户当前是否适合被打断。 论文

最值得试的组合:先把 CAPod 一类的佩戴事件和媒体暂停/恢复做成状态入口,再接一个 Personal Jarvis/自有 Agent 式后台;实时语音用移动端 Realtime,电话只作为高优先级未确认后的独立兜底。这个组合目前只是工程推断,还没有整体实测。

来源:官网/仓库已查|国内已查|论文已查|X公开搜索仅摘要/收录有限。