---
{"schema":1,"date":"2026-09-19","timezone":"Asia/Shanghai","title":"电话语音 Agent 每日观察","revision":1,"publication":"publish","review_status":"generated","summary":["Qwen Audio Agent已具备移动工程骨架、唤醒和后台任务并行。","Pipecat 1.11把非阻塞工具调用和轮次评测接进实时语音。","新论文提醒：全双工模型仍不会在真正该打断时主动开口。"],"events":[{"project":"qwen-audio-agent-mobile","title":"9月19日提交继续扩展可组合实时前端；仓库已包含Android/iOS移动工程、唤醒词、后台任务与OpenClaw桥接","kind":"code","event_date":"2026-09-19","publication_date":"2026-09-19","discovered_date":"2026-09-19","evidence":"verified","source":"https://github.com/QwenAudio/qwen-audio-agent/commit/7b5913a05666a6cab9681c301807206ffa66c106"},{"project":"pipecat-1-11-0","title":"9月18日Pipecat 1.11.0接入Gemini 3.8 Live非阻塞工具调用，并增强轮次完成与函数调用评测","kind":"release","event_date":"2026-09-18","publication_date":"2026-09-18","discovered_date":"2026-09-19","evidence":"verified","source":"https://github.com/pipecat-ai/pipecat/releases/tag/v1.11.0"},{"project":"full-duplex-take-floor","title":"9月17日论文发现全双工语音模型擅长被点名后开口，却很少因错误事实或危险主动介入","kind":"paper","event_date":"2026-09-17","publication_date":"2026-09-17","discovered_date":"2026-09-19","evidence":"source-claim","source":"https://arxiv.org/abs/2609.19596"},{"project":"bolna-0-10-242","title":"七日补漏：Bolna 0.10.242允许按图节点单独配置打断阈值和路由模型","kind":"release","event_date":"2026-09-17","publication_date":"2026-09-17","discovered_date":"2026-09-19","evidence":"verified","source":"https://github.com/bolna-ai/bolna/releases/tag/0.10.242"}]}
---
# 电话语音 Agent 日报｜2026-09-19

今天最接近目标的不是一体化成品，而是“耳机前台持续对话 + 后台 Agent 继续干活”这条链已经出现更像样的开源骨架；真正的短板反而落到了手机后台、佩戴判断和“什么时候值得主动打断”上。

## 重点

**Qwen Audio Agent 值得升到第一观察位。** 仓库已经把全双工对话、语音唤醒“你好千问”、后台多任务、进度查询/取消、长期记忆以及 OpenClaw 等 Agent 接在同一套运行时里；源码里也确实存在 Android 与 iOS 的移动工程。9 月 19 日最新提交继续扩展可组合实时前端。不过官方 README 仍明确说当前重心是桌面生产力，所以现阶段只能说明“手机壳子和核心能力都在”，还不能证明锁屏常驻、耳机入耳检测、跨 Spotify/播客插播已经可用。[仓库](https://github.com/QwenAudio/qwen-audio-agent)｜[今日提交](https://github.com/QwenAudio/qwen-audio-agent/commit/7b5913a05666a6cab9681c301807206ffa66c106)

**Pipecat 1.11.0 把后台工具调用和实时对话接得更顺。** 9 月 18 日发布版正式支持 Gemini 3.8 Live 的非阻塞函数调用，也增加函数调用判定、轮次完成标记和脚本化评测；这正适合验证“我还在和耳机里的助手说话时，后台任务能不能继续跑、插话后会不会误收尾”。它仍是语音运行时，不负责耳机佩戴、系统通知或电话升级，但作为中间层已经很接近可组合核心。[Release](https://github.com/pipecat-ai/pipecat/releases/tag/v1.11.0)

**新论文提醒：会全双工不等于会主动判断什么时候该说。** 9 月 17 日的研究测试五类全双工模型，发现它们对“被点名”和“出现停顿”反应明显更好，却很少因为错误事实或危险内容主动插话。作者结果还没被我独立复测，但这正撞上我们的关键需求：主动提醒不能只靠静音窗口，必须另做内容重要度、用户可打断性和确认状态判断。[论文](https://arxiv.org/abs/2609.19596)

顺手看：Bolna 0.10.242 已允许按对话图节点单独调打断阈值，适合把“闲聊”和“敏感确认”分成不同打断策略；仍偏电话/网页语音链路，不是耳机客户端。[Release](https://github.com/bolna-ai/bolna/releases/tag/0.10.242)

最值得试的是：拿 Qwen Audio Agent 的移动工程做前台，先只验证“耳机已连接时唤醒 + 后台任务并行 + 文字留底”，再补佩戴传感和电话升级，别一上来把所有链路焊成一块。

来源：官网/仓库已查｜国内已查（Qwen等）｜论文已查｜X公开检索已执行但收录有限，按覆盖受限处理。
