gemini-live-api-devGoogle官方放心用装上它 AI 就能用 Gemini Live API 做低延迟双向音视频实时交互。
这个 Skill 覆盖 Gemini Live API 的全栈开发细节:通过 WebSocket 建立低延迟双向流,支持实时音频(输入 PCM 16kHz、输出 24kHz)、视频帧、文字输入输出;内置语音活动检测(VAD)自动打断,支持原生音频输出与 thinkingLevel 思考、同步函数调用、Google Search grounding,以及会话压缩/恢复/GoAway 等会话管理。客户端可用临时令牌(ephemeral tokens)安全鉴权,SDK 使用 Python 的 google-genai 或 JS/TS 的 @google/genai,推荐模型为 gemini-3.1-flash-live-preview,翻译场景可用 gemini-3.5-live-translate-preview。
适合开发实时语音助手、视频对话、同声传译、屏幕共享互动等应用。注意目前 Live API 仅支持 WebSocket,想走 WebRTC 可用 LiveKit、Pipecat 等合作伙伴;旧版 SDK 已废弃,实时输入要用 sendRealtimeInput,sendClientContent 仅用于注入初始上下文。
在下面找到你用的工具,复制命令粘进终端就装好了:
npx skills add google-gemini/gemini-skills 装好后不用任何配置,直接在对话里说:
用 google-genai 连上 Flash Live 模型,帮我搭一个实时语音对话 Demo。 AI 检测到任务匹配时会自动加载这个 Skill,不需要手动开关。
SKILL.md 目前 Live API 仅支持 WebSocket。如需 WebRTC 或更简集成,可使用 LiveKit、Pipecat、Fishjam 等合作伙伴方案。
对话中新的音频、视频、文字都必须用 sendRealtimeInput;sendClientContent 只在开启 initial_history_in_client_content 时用于注入初始上下文。
不能。Python 的 google-generativeai 和 JS 的 @google/generative-ai 已废弃,请迁移到 google-genai 或 @google/genai。