<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>Speech on AI</title>
        <link>https://ai.programnotes.cn/tags/speech/</link>
        <description>Recent content in Speech on AI</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-CN</language>
        <lastBuildDate>Fri, 31 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://ai.programnotes.cn/tags/speech/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>GitHub Trending 榜首：speech-to-speech —— 用开源模型构建本地语音代理</title>
        <link>https://ai.programnotes.cn/p/github-trending-%E6%A6%9C%E9%A6%96speech-to-speech-%E7%94%A8%E5%BC%80%E6%BA%90%E6%A8%A1%E5%9E%8B%E6%9E%84%E5%BB%BA%E6%9C%AC%E5%9C%B0%E8%AF%AD%E9%9F%B3%E4%BB%A3%E7%90%86/</link>
        <pubDate>Fri, 31 Jul 2026 00:00:00 +0000</pubDate>
        
        <guid>https://ai.programnotes.cn/p/github-trending-%E6%A6%9C%E9%A6%96speech-to-speech-%E7%94%A8%E5%BC%80%E6%BA%90%E6%A8%A1%E5%9E%8B%E6%9E%84%E5%BB%BA%E6%9C%AC%E5%9C%B0%E8%AF%AD%E9%9F%B3%E4%BB%A3%E7%90%86/</guid>
        <description>&lt;img src="https://ai.programnotes.cn/img/ai/AI.png" alt="Featured image of post GitHub Trending 榜首：speech-to-speech —— 用开源模型构建本地语音代理" /&gt;&lt;h2 id=&#34;项目简介&#34;&gt;项目简介
&lt;/h2&gt;&lt;p&gt;&lt;a class=&#34;link&#34; href=&#34;https://github.com/huggingface/speech-to-speech&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;speech-to-speech&lt;/a&gt; 是 Hugging Face 推出的开源语音对话系统，旨在让开发者用纯开源模型在本地构建低延迟的语音智能体。项目采用经典的 &lt;strong&gt;VAD → STT → LLM → TTS&lt;/strong&gt; 四级级联架构，通过 OpenAI Realtime 兼容的 WebSocket API 对外暴露服务，目前已获 &lt;strong&gt;9,400+ Star&lt;/strong&gt;，Apache 2.0 协议开源。&lt;/p&gt;
&lt;h2 id=&#34;核心亮点&#34;&gt;核心亮点
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;全模块可替换&lt;/strong&gt;是该项目最大的设计哲学。VAD（语音活动检测）、STT（语音转文字）、LLM（大语言模型）、TTS（文字转语音）四个环节各自独立，每个环节都提供多个后端实现，通过 CLI 参数即可灵活切换。无论你想用 Whisper 还是 Paraformer 做语音识别，用 OpenAI API 还是本地 llama.cpp 跑大模型，用 Kokoro 还是 ChatTTS 合成语音，都能自由组合。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;LLM 部署方式极其灵活&lt;/strong&gt;：支持托管 API（OpenAI、HF Inference Providers、OpenRouter）、自托管服务器（vLLM、llama.cpp），以及本地进程直接加载（Transformers、mlx-lm）。这意味着从纯云端到完全离线的部署方案都能覆盖。&lt;/p&gt;
&lt;h2 id=&#34;默认技术栈&#34;&gt;默认技术栈
&lt;/h2&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;组件&lt;/th&gt;
					&lt;th&gt;默认后端&lt;/th&gt;
					&lt;th&gt;可选后端&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;VAD&lt;/td&gt;
					&lt;td&gt;Silero VAD v5&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;STT&lt;/td&gt;
					&lt;td&gt;Parakeet TDT&lt;/td&gt;
					&lt;td&gt;Whisper / Faster Whisper / Lightning Whisper MLX / Paraformer&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;LLM&lt;/td&gt;
					&lt;td&gt;OpenAI Responses API&lt;/td&gt;
					&lt;td&gt;Transformers / mlx-lm / Chat Completions 兼容接口&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;TTS&lt;/td&gt;
					&lt;td&gt;Qwen3-TTS&lt;/td&gt;
					&lt;td&gt;Kokoro-82M / Pocket TTS / ChatTTS / MMS TTS&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id=&#34;快速上手&#34;&gt;快速上手
&lt;/h2&gt;&lt;p&gt;安装和启动极其简洁：&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;
&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;2
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;3
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-bash&#34; data-lang=&#34;bash&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;pip install speech-to-speech
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;nb&#34;&gt;export&lt;/span&gt; &lt;span class=&#34;nv&#34;&gt;OPENAI_API_KEY&lt;/span&gt;&lt;span class=&#34;o&#34;&gt;=&lt;/span&gt;...
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;speech-to-speech
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;启动后即可在 &lt;code&gt;ws://localhost:8765/v1/realtime&lt;/code&gt; 获得一个兼容 OpenAI Realtime 协议的 WebSocket 端点，任何兼容该协议的客户端都能直接接入对话。&lt;/p&gt;
&lt;h2 id=&#34;四种运行模式&#34;&gt;四种运行模式
&lt;/h2&gt;&lt;p&gt;项目支持四种部署模式以适应不同场景：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;realtime&lt;/strong&gt;（默认）：WebSocket + OpenAI Realtime 协议，适合集成到现有应用&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;local&lt;/strong&gt;：直接调用本地麦克风和扬声器进行语音对话&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;websocket&lt;/strong&gt;：原始 PCM 音频流传输，适合自定义前端&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;socket&lt;/strong&gt;：TCP 传输模式&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;macOS 用户可以通过 &lt;code&gt;--local_mac_optimal_settings&lt;/code&gt; 一键启用 MPS 加速的本地优化配置，项目还提供了 Docker Compose 方案（含 llama.cpp + Gemma 4）实现一键部署。&lt;/p&gt;
&lt;h2 id=&#34;生产级验证&#34;&gt;生产级验证
&lt;/h2&gt;&lt;p&gt;该项目已在生产环境中支撑&lt;strong&gt;数千台 Reachy Mini 机器人&lt;/strong&gt;的对话后端，证明了其在真实场景下的可靠性和低延迟表现。Realtime API 实现了完整的打断处理、实时转录回传和工具调用事件，具备真正的生产可用性。&lt;/p&gt;
&lt;h2 id=&#34;小结&#34;&gt;小结
&lt;/h2&gt;&lt;p&gt;speech-to-speech 的价值在于把语音对话系统从&amp;quot;调参炼丹&amp;quot;变成了&amp;quot;搭积木组合&amp;quot;——每个环节都可以独立选型和替换，同时又保持了低延迟的生产级品质。无论是想做本地语音助手、机器人对话系统，还是研究语音交互流水线，这都是目前开源生态中最值得关注的项目之一。&lt;/p&gt;
</description>
        </item>
        
    </channel>
</rss>
