路线 A · 网页端
不需要任何硬件,用浏览器就能跑通整条语音链路。推荐先用这条路线确认模型没问题。
路线 B · 硬件端
把开源小智固件刷进 ESP32 设备,通过 OTA 指到本服务端,就能用语音唤醒对话。
先做这一步
无论哪条路线,都要先准备好模型接口。没有 API Key,后面所有步骤都会卡住。
先备好三样东西
服务端本身不提供模型,需要你自己提供接口地址和密钥。三类能力可以来自不同厂商。
| 需要什么 | 说明 | 关键参数 |
|---|---|---|
| 大语言模型 | 决定回答质量与人设表现,必填。任何兼容 OpenAI 请求格式的服务都可以。 | 接口地址、模型名、API Key |
| 语音合成 TTS | 决定音色。不配置就无法出声,强烈建议配置。 | 接口地址、音色名、API Key |
| 语音识别 ASR | 把语音转成文字。不配置时网页端会退回浏览器内置识别,稳定性较差。 | 接口地址、模型名、API Key |
网页端:五步跑通语音对话
全程在浏览器里完成,中途不需要碰服务器。
注册并登录
打开 注册页 创建账号。注册成功后系统会自动建好一个默认智能体,并自动登录进入控制台。
配置模型
左侧菜单进入「模型配置」,分别新建 LLM、TTS、ASR 三条记录,
填好接口地址、模型名与密钥。不知道填什么时,优先照厂商文档里的
base_url 与 model 抄。
保存后点每条记录上的「测试」按钮,看到成功提示再继续。
指定智能体用哪套模型
进入「智能体」→ 编辑,把 LLM / TTS / ASR 分别选成刚配置好的条目。 如果管理员已设置全局默认,这一步通常会自动带上,确认一下即可。
同一个页面里还能写系统提示词(人设)、开场白,以及开关「语音打断」和「智能记忆」。
开始对话
进入「智能对话」。按住底部麦克风按钮说话,松手发送;也可以直接打字。 AI 回答时你若再次按下麦克风说话,它会立刻停下来听你说。
查看效果与排错
回到「概览」看对话趋势;到「对话记录」回看每一轮问答,被中途打断的回答会标记为「已中断」。 如果模型调用失败,去「系统设置 → 运行日志」找具体错误信息。
| 想做什么 | 去哪里 |
|---|---|
| 配模型密钥 | 模型配置 |
| 改人设 / 开场白 | 智能体 → 编辑 |
| 开关打断、记忆 | 智能体 → 编辑 → 对话行为 |
| 看记住过什么 | 智能记忆 |
| 回看历史对话 | 对话记录 |
| 全局开关与日志 | 系统设置(管理员) |
- 麦克风点不动:浏览器要求 HTTPS 才允许录音,请用 https 地址访问。
- 有文字没声音:多半是 TTS 没配或音色名填错。
- 回答很久才出声:换一个响应更快的模型服务,服务端侧已经是流式下发。
硬件端:让小智音箱连上你的服务端
这里以开源「小智」ESP32 固件为例。整体思路只有一句话:把设备固件里的 OTA 地址改成你的域名, 设备就会自动向本服务端注册。
准备设备
一块 ESP32-S3 开发板(或成品小智模块),配一个数字麦克风与一个喇叭。 接线按固件仓库的说明来,接错麦克风是最常见的「没声音」原因。
刷入固件并改 OTA 地址
用官方提供的烧录工具刷入固件。记得在配置里把 OTA 地址从公共服务器改成本服务端地址,
路径固定为 /ota/:
// 把设备固件里的 OTA 地址改为 https://你的域名/ota/
注意要带 https://,末尾保留斜杠。用 http 访问时设备会走明文连接,仅建议内网调试。
上电配网
设备首次开机会进入配网模式,用手机连上它开的热点,把家里的 WiFi 名称与密码填进去。 配网成功后设备重启,屏幕上或串口日志里会出现连接状态。
获取验证码并绑定
设备向 OTA 接口报到后,会拿到一个 6 位数字验证码,并显示在设备屏幕或串口日志里。 回到控制台进入「设备管理」,在绑定区填入这串数字并选择归属智能体,点绑定即可。
安全设计:验证码 10 分钟内有效、只对未绑定设备下发一次、绑定成功后立即作废; 同一个账号 10 分钟内最多尝试 10 次,避免被逐个试出来。
语音唤醒开始对话
绑定完成后重启设备,用唤醒词唤醒它,直接说话即可。 设备说的每一句话都会走你配置的那套模型,对话记录也会同步出现在后台。
在「设备管理」里可以随时重新下发验证码(换绑账号时用)或删除设备。
- 串口日志里 OTA 请求有没有返回 200
- OTA 地址末尾斜杠、协议是否写对
- 域名证书是否受信任(自签证书设备会拒连)
- 设备是否已被其他账号绑定(需先解绑)
| 用途 | 地址 |
|---|---|
| 设备 OTA 报到 | /ota/ |
| 设备语音长连接 | /ws/(由 OTA 自动下发) |
| 控制台 | /console |
| 网页对话 | /chat |
用顺了之后,试试这几件事
把记忆调成你要的强度
「系统设置 → 对话行为」里有三种抽取策略:关闭、每几轮抽一次并在会话结束时补抽(推荐)、每轮都抽。 追求更懂你就选每轮,想省 token 就选推荐档。还能限制每个智能体最多保留多少条记忆。
为不同场景建多个智能体
一个做生活助手、一个做行业问答、一个专门讲故事,各自写不同的人设与开场白, 甚至可以指定不同的模型组合来对比效果。网页端顶部可以随时切换。
开放给家人或同事用
在「系统设置」打开自助注册,或由管理员在「用户管理」里建号。 每个账号的设备、智能体与记忆完全隔离,互不可见,可以放心共用一套服务端。