首页 / 使用教程

使用教程

从零到听见第一句话,通常不超过十分钟。下面分「网页端」和「硬件端」两条路线, 你先挑一条走通,再回头看进阶部分。

路线 A · 网页端

不需要任何硬件,用浏览器就能跑通整条语音链路。推荐先用这条路线确认模型没问题。

路线 B · 硬件端

把开源小智固件刷进 ESP32 设备,通过 OTA 指到本服务端,就能用语音唤醒对话。

先做这一步

无论哪条路线,都要先准备好模型接口。没有 API Key,后面所有步骤都会卡住。

第 0 步

先备好三样东西

服务端本身不提供模型,需要你自己提供接口地址和密钥。三类能力可以来自不同厂商。

需要什么 说明 关键参数
大语言模型 决定回答质量与人设表现,必填。任何兼容 OpenAI 请求格式的服务都可以。 接口地址、模型名、API Key
语音合成 TTS 决定音色。不配置就无法出声,强烈建议配置。 接口地址、音色名、API Key
语音识别 ASR 把语音转成文字。不配置时网页端会退回浏览器内置识别,稳定性较差。 接口地址、模型名、API Key
关于费用:本服务端本身不收取任何费用,你需要支付的是所选模型服务的调用费用。 建议先各充少量额度跑通流程,确认效果后再放大。
路线 A

网页端:五步跑通语音对话

全程在浏览器里完成,中途不需要碰服务器。

注册并登录

打开 注册页 创建账号。注册成功后系统会自动建好一个默认智能体,并自动登录进入控制台。

配置模型

左侧菜单进入「模型配置」,分别新建 LLMTTSASR 三条记录, 填好接口地址、模型名与密钥。不知道填什么时,优先照厂商文档里的 base_urlmodel 抄。

保存后点每条记录上的「测试」按钮,看到成功提示再继续。

指定智能体用哪套模型

进入「智能体」→ 编辑,把 LLM / TTS / ASR 分别选成刚配置好的条目。 如果管理员已设置全局默认,这一步通常会自动带上,确认一下即可。

同一个页面里还能写系统提示词(人设)、开场白,以及开关「语音打断」和「智能记忆」。

开始对话

进入「智能对话」。按住底部麦克风按钮说话,松手发送;也可以直接打字。 AI 回答时你若再次按下麦克风说话,它会立刻停下来听你说。

查看效果与排错

回到「概览」看对话趋势;到「对话记录」回看每一轮问答,被中途打断的回答会标记为「已中断」。 如果模型调用失败,去「系统设置 → 运行日志」找具体错误信息。

网页端小抄
想做什么去哪里
配模型密钥模型配置
改人设 / 开场白智能体 → 编辑
开关打断、记忆智能体 → 编辑 → 对话行为
看记住过什么智能记忆
回看历史对话对话记录
全局开关与日志系统设置(管理员)
常见卡点
  • 麦克风点不动:浏览器要求 HTTPS 才允许录音,请用 https 地址访问。
  • 有文字没声音:多半是 TTS 没配或音色名填错。
  • 回答很久才出声:换一个响应更快的模型服务,服务端侧已经是流式下发。
路线 B

硬件端:让小智音箱连上你的服务端

这里以开源「小智」ESP32 固件为例。整体思路只有一句话:把设备固件里的 OTA 地址改成你的域名, 设备就会自动向本服务端注册。

准备设备

一块 ESP32-S3 开发板(或成品小智模块),配一个数字麦克风与一个喇叭。 接线按固件仓库的说明来,接错麦克风是最常见的「没声音」原因。

刷入固件并改 OTA 地址

用官方提供的烧录工具刷入固件。记得在配置里把 OTA 地址从公共服务器改成本服务端地址, 路径固定为 /ota/

// 把设备固件里的 OTA 地址改为
https://你的域名/ota/

注意要带 https://,末尾保留斜杠。用 http 访问时设备会走明文连接,仅建议内网调试。

上电配网

设备首次开机会进入配网模式,用手机连上它开的热点,把家里的 WiFi 名称与密码填进去。 配网成功后设备重启,屏幕上或串口日志里会出现连接状态。

获取验证码并绑定

设备向 OTA 接口报到后,会拿到一个 6 位数字验证码,并显示在设备屏幕或串口日志里。 回到控制台进入「设备管理」,在绑定区填入这串数字并选择归属智能体,点绑定即可。

安全设计:验证码 10 分钟内有效、只对未绑定设备下发一次、绑定成功后立即作废; 同一个账号 10 分钟内最多尝试 10 次,避免被逐个试出来。

语音唤醒开始对话

绑定完成后重启设备,用唤醒词唤醒它,直接说话即可。 设备说的每一句话都会走你配置的那套模型,对话记录也会同步出现在后台。

在「设备管理」里可以随时重新下发验证码(换绑账号时用)或删除设备。

设备连不上?按顺序排查
  • 串口日志里 OTA 请求有没有返回 200
  • OTA 地址末尾斜杠、协议是否写对
  • 域名证书是否受信任(自签证书设备会拒连)
  • 设备是否已被其他账号绑定(需先解绑)
常用地址
用途地址
设备 OTA 报到/ota/
设备语音长连接/ws/(由 OTA 自动下发)
控制台/console
网页对话/chat
进阶

用顺了之后,试试这几件事

把记忆调成你要的强度

「系统设置 → 对话行为」里有三种抽取策略:关闭、每几轮抽一次并在会话结束时补抽(推荐)、每轮都抽。 追求更懂你就选每轮,想省 token 就选推荐档。还能限制每个智能体最多保留多少条记忆。

为不同场景建多个智能体

一个做生活助手、一个做行业问答、一个专门讲故事,各自写不同的人设与开场白, 甚至可以指定不同的模型组合来对比效果。网页端顶部可以随时切换。

开放给家人或同事用

在「系统设置」打开自助注册,或由管理员在「用户管理」里建号。 每个账号的设备、智能体与记忆完全隔离,互不可见,可以放心共用一套服务端。

把能力接进自己的应用

在保留登录态的前提下,可以用 /api/asr 做语音转文字、用 /api/nlu 直接拿模型回答, 把智能体能力嵌进小程序、公众号或内部系统。详见 功能特色 · 开放接口

还有问题?先看看常见问题

部署、模型、硬件、隐私相关的高频疑问都整理好了。