
AssemblyAI 是一个面向开发者的语音 AI 基础设施平台,提供行业领先的预录和实时语音转文本、语音代理 API,帮助开发者高效构建语音应用。

Pre-recorded Speech-to-Text API
支持 99 种语言,提供高准确率的可定制转录服务,并支持自然语言提示(如 Universal-3.5 Pro、Universal-2 模型)。
Realtime Speech-to-Text API
实时流式转录,延迟低且准确率接近异步水平,适用于语音代理等场景(支持 Universal-3.5 Pro Realtime、Universal-Streaming 等模型)。
Sync Speech-to-Text API
发送短音频片段后,在同一响应中直接返回旗舰级准确率的转录结果,无需轮询或 WebSocket。
Voice Agent API
内置话轮检测和中断处理,帮助开发者快速构建生产级语音代理,无需处理复杂底层逻辑。
Speech Understanding API
单次 API 调用即可提取说话人识别、情感分析、章节划分、摘要等高级理解能力。
Guardrails
在音频和转录文本中实时编辑 PII(个人身份信息)和内容审核,确保敏感数据不进入日志或 LLM。
LLM Gateway
通过统一端点路由到多个 LLM(如 GPT、Claude、Gemini、社区模型),内置故障转移机制,可在不修改代码的情况下切换模型或应对服务中断。