上传音频文件,自动进行语音识别(ASR)并翻译为目标语言文本。支持多种音频格式和语言,满足会议翻译、访谈翻译、课程翻译等多种场景需求。Upload audio files for automatic speech recognition (ASR) and translation into target language text. Supports multiple formats and languages for meetings, interviews, courses, and more.
快速概览
Quick Overview
属性
Attribute
说明
Description
端点
Endpoint
POST /v1/speech/translate
认证
Authentication
Bearer Token(Authorization 请求头)
Bearer Token in Authorization header
输入方式
Input Method
本地文件上传(multipart/form-data)或音频 URL
Local file upload (multipart/form-data) or audio URL
音频上限
Audio Limit
最大 100MB,最长 2 小时
Max 100MB, max 2 hours
源语言检测
Source Language
支持自动检测,也支持手动指定
Auto-detection supported, manual specification also available
输出模式
Output Modes
text(纯译文)/ srt(字幕)/ full(完整信息)
text (translation only) / srt (subtitles) / full (complete info)
支持语言
Supported Languages
中文、英语、日语、韩语、法语、德语、西班牙语、葡萄牙语等 30+ 种语言
Chinese, English, Japanese, Korean, French, German, Spanish, Portuguese, and 30+ more
超时时间
Timeout
同步模式 60 秒,超长音频建议使用异步回调
60s synchronous timeout; use async callback for long audio
请求端点
Endpoint
POST/v1/speech/translate
认证
Authentication
所有 API 请求需在 HTTP Header 中携带 Access Token,不支持 URL 参数传递。
All API requests must include an Access Token in the HTTP Header. URL parameter passing is not supported.
Authorization: Bearer {access_token}
请求头
Request Headers
请求头
Header
必填
Required
说明
Description
Authorization
required
格式 Bearer {access_token},用于身份认证
Format: Bearer {access_token}, used for authentication
Content-Type
required
multipart/form-data,由 HTTP 客户端自动设置
multipart/form-data, auto-set by HTTP client
请求参数
Request Parameters
参数
Parameter
类型
Type
必填
Required
说明
Description
file
file
required
音频文件,最大 100MB,最长 2 小时
Audio file, max 100MB, max 2 hours
audio_url
string
optional
音频文件的公网可访问 URL(与 file 二选一)
Publicly accessible URL of the audio file (alternative to file)
target_lang
string
required
目标翻译语言代码,如 en、ja、ko
Target language code, e.g. en, ja, ko
source_lang
string
optional
源语言代码,不传则自动检测。已知语言建议显式指定以获得更优效果
Source language code, auto-detected if omitted. Explicit specification recommended for better accuracy
Speaker label (when diarization enabled), e.g. speaker_0, speaker_1
segments[].confidence
number
ASR 识别置信度(0-1)
ASR confidence score (0-1)
srt_content
string
SRT 格式字幕内容(仅 output_type=srt 时返回)
SRT subtitle content (only when output_type=srt)
billed_duration
number
计费时长(秒),为实际计费的音频长度
Billed duration in seconds
响应示例
Response Examples
text 模式 — 仅翻译文本
text Mode — Translation Only
{
"translated_text": "Today we will discuss the plan for next quarter.",
"source_lang": "zh",
"target_lang": "en",
"duration": 6.5,
"billed_duration": 7.0
}
full 模式 — 完整信息(含时间戳)
full Mode — Complete Info (with timestamps)
{
"translated_text": "Today we will discuss the plan for next quarter.",
"transcript": "今天我们要讨论下个季度的计划。",
"source_lang": "zh",
"target_lang": "en",
"duration": 6.5,
"billed_duration": 7.0,
"segments": [
{
"start": 0.0,
"end": 3.2,
"source": "今天我们要讨论",
"translation": "Today we will discuss",
"confidence": 0.98
},
{
"start": 3.2,
"end": 6.5,
"source": "下个季度的计划。",
"translation": "the plan for next quarter.",
"confidence": 0.95
}
]
}
full 模式 + 说话人分离
full Mode + Speaker Diarization
{
"translated_text": "Good morning everyone. I'd like to start with sales report. Last month we saw a 15% growth.",
"transcript": "大家早上好。我想先说一下销售报告。上个月我们增长了15%。",
"source_lang": "zh",
"target_lang": "en",
"duration": 12.3,
"segments": [
{
"start": 0.0, "end": 4.5,
"speaker": "speaker_0",
"source": "大家早上好。",
"translation": "Good morning everyone.",
"confidence": 0.99
},
{
"start": 4.5, "end": 9.0,
"speaker": "speaker_1",
"source": "我想先说一下销售报告。",
"translation": "I'd like to start with sales report.",
"confidence": 0.96
},
{
"start": 9.0, "end": 12.3,
"speaker": "speaker_1",
"source": "上个月我们增长了15%。",
"translation": "Last month we saw a 15% growth.",
"confidence": 0.97
}
]
}
srt 模式 — 双语字幕
srt Mode — Bilingual Subtitles
{
"source_lang": "zh",
"target_lang": "en",
"duration": 6.5,
"translated_text": "Today we will discuss the plan for next quarter.",
"srt_content": "1\n00:00:00,000 --> 00:00:03,200\n今天我们要讨论\nToday we will discuss\n\n2\n00:00:03,200 --> 00:00:06,500\n下个季度的计划。\nthe plan for next quarter.\n"
}
错误码
Error Codes
Status
错误码
Code
说明
Description
400
MISSING_PARAM
缺少必填参数(file 或 target_lang)
Missing required parameter (file or target_lang)
400
UNSUPPORTED_AUDIO
不支持的音频格式
Unsupported audio format
400
AUDIO_TOO_LONG
音频超过 2 小时限制
Audio exceeds 2-hour limit
400
AUDIO_TOO_LARGE
音频文件超过 100MB 限制
Audio file exceeds 100MB limit
400
NO_SPEECH_DETECTED
未检测到语音内容
No speech detected
400
INVALID_AUDIO_URL
音频 URL 无法访问或下载超时
Audio URL inaccessible or download timeout
400
UNSUPPORTED_LANG
不支持的语言代码
Unsupported language code
400
LOW_CONFIDENCE
音频质量过低,识别置信度不足
Audio quality too low, insufficient confidence
401
UNAUTHORIZED
Access Token 无效或已过期
Invalid or expired Access Token
403
FORBIDDEN
无权限访问该资源或超出套餐配额
No permission or quota exceeded
413
PAYLOAD_TOO_LARGE
请求体超过大小限制
Request body exceeds size limit
429
RATE_LIMITED
请求频率超限,请降低并发或稍后重试
Rate limit exceeded, reduce concurrency or retry later
456
QUOTA_EXCEEDED
套餐配额已用尽,请升级或等待重置
Plan quota exhausted, upgrade or wait for reset
500
INTERNAL_ERROR
服务器内部错误,请稍后重试
Internal server error, please retry later
503
SERVICE_UNAVAILABLE
服务暂时不可用,建议重试
Service temporarily unavailable, retry recommended