语言检测Language Detection

自动识别文本所使用的语言,返回语言代码及置信度。支持 100+ 语言的精准识别。Automatically identify the language of input text with confidence scores. Supports 100+ languages.

快速概览

语言检测 API 基于深度学习模型,可精准识别 100+ 种语言及其变体。支持返回 top 1~5 个候选语言及置信度分数,并能自动识别文本所使用的书写系统(拉丁字母、西里尔字母、CJK 等)。建议输入至少 10 个字符以确保准确率,单次最多检测 5,000 字符。 The Language Detection API uses deep learning models to accurately identify 100+ languages and variants. Returns top 1-5 candidate languages with confidence scores, and can auto-detect the writing script (Latin, Cyrillic, CJK, etc.). Recommend at least 10 characters for accuracy; max 5,000 characters per request.

请求端点

Endpoint

POST/v1/language/detect

认证方式

Authentication

所有 API 请求均需要在 HTTP 请求头中携带有效的 API Token 进行身份认证。请在 控制台 获取您的 Access Token。

All API requests require a valid API Token in the HTTP request header for authentication. Obtain your Access Token from the Console.

Authorization: Bearer {access_token}

请求头

Request Headers

HeaderHeader类型Type必填Required说明Description
AuthorizationstringrequiredBearer Token 认证信息Bearer token authentication
Content-Typestringrequired请求体格式,固定为 application/jsonRequest body format; fixed to application/json

请求参数

Request Parameters

参数Parameter类型Type必填Required说明Description
textstringrequired待检测文本,建议至少 10 个字符,最长 5,000 字符Text to detect; recommend ≥10 chars, max 5,000 chars
top_nintegeroptional返回置信度最高的 N 个候选语言,默认 1,最大 5Return top N candidates; default 1, max 5
min_confidencefloatoptional最低置信度阈值 0~1,低于此值的候选将被过滤,默认 0 不过滤Minimum confidence threshold 0~1; candidates below this are filtered; default 0
return_scriptbooleanoptional是否返回文本书写系统信息(如 Latin、Cyrillic、Han),默认 falseReturn writing script info (e.g. Latin, Cyrillic, Han); default false
hint_langstringoptional提供候选语言代码以提升短文本检测精度,如 zhjaHint language code to improve short text accuracy, e.g. zh, ja

响应字段

Response Fields

字段Field类型Type说明Description
codeinteger状态码,0 表示成功Status code; 0 = success
messagestring操作结果描述Result description
data.detectionsarray检测结果列表,按置信度降序排列Detection results, sorted by confidence descending
data.detections[].languagestringISO 639-1 或 ISO 639-3 语言代码ISO 639-1 or ISO 639-3 language code
data.detections[].language_namestring语言的英文名称English language name
data.detections[].confidencefloat置信度分数,范围 0~1,越高越可信Confidence score 0~1; higher is more reliable
data.detections[].scriptstring书写系统(仅 return_script=true 时返回),如 Latin、Cyrillic、Han、Arabic、DevanagariWriting script (only when return_script=true); e.g. Latin, Cyrillic, Han, Arabic, Devanagari
data.text_lengthinteger输入文本的字符数Character count of input text

支持的书写系统

Supported Scripts

书写系统Script代表语言Representative Languages
Latin英语、法语、德语、西班牙语、越南语等English, French, German, Spanish, Vietnamese, etc.
Cyrillic俄语、保加利亚语、塞尔维亚语、乌克兰语等Russian, Bulgarian, Serbian, Ukrainian, etc.
Han中文(简体/繁体)、日文汉字Chinese (Simplified/Traditional), Japanese Kanji
Arabic阿拉伯语、波斯语、乌尔都语Arabic, Persian, Urdu
Devanagari印地语、尼泊尔语、马拉地语、梵语Hindi, Nepali, Marathi, Sanskrit
Hangul韩语Korean
Kana日语(平假名/片假名)Japanese (Hiragana/Katakana)
Thai泰语、老挝语Thai, Lao

请求示例

Request Examples

# 基础检测:返回 Top 3 候选语言
curl -X POST https://api.itranslator.cc/v1/language/detect \
  -H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{"text": "Bonjour, comment allez-vous?", "top_n": 3}'

# 短文本 + 提示语言 + 返回书写系统
curl -X POST https://api.itranslator.cc/v1/language/detect \
  -H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{"text": "今天天气真好", "top_n": 2, "hint_lang": "zh", "return_script": true, "min_confidence": 0.5}'

# 代码注释语言检测
curl -X POST https://api.itranslator.cc/v1/language/detect \
  -H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{"text": "// Diese Funktion berechnet die Summe aller Elemente im Array", "top_n": 1}'

响应示例

Response Examples

示例 1:基础检测(Top 3)

Example 1: Basic Detection (Top 3)

{
  "code": 0,
  "message": "success",
  "data": {
    "text_length": 28,
    "detections": [
      { "language": "fr", "language_name": "French",  "confidence": 0.98 },
      { "language": "ca", "language_name": "Catalan", "confidence": 0.01 },
      { "language": "es", "language_name": "Spanish", "confidence": 0.01 }
    ]
  }
}

示例 2:短文本 + 提示语言 + 书写系统

Example 2: Short Text + Hint + Script

{
  "code": 0,
  "message": "success",
  "data": {
    "text_length": 6,
    "detections": [
      {
        "language": "zh",
        "language_name": "Chinese (Simplified)",
        "confidence": 0.96,
        "script": "Han"
      },
      {
        "language": "ja",
        "language_name": "Japanese",
        "confidence": 0.04,
        "script": "Han"
      }
    ]
  }
}

示例 3:代码注释语言检测

Example 3: Code Comment Detection

{
  "code": 0,
  "message": "success",
  "data": {
    "text_length": 62,
    "detections": [
      { "language": "de", "language_name": "German", "confidence": 0.99 }
    ]
  }
}

示例 4:混合语言文本

Example 4: Mixed-language Text

{
  "code": 0,
  "message": "success",
  "data": {
    "text_length": 40,
    "detections": [
      { "language": "en", "language_name": "English", "confidence": 0.75 },
      { "language": "fr", "language_name": "French",  "confidence": 0.20 },
      { "language": "es", "language_name": "Spanish", "confidence": 0.05 }
    ]
  }
}

使用限制

Usage Limits

限制项Limit Item上限Cap说明Notes
单次文本长度Text length5,000 字符chars超出请截断或分段Truncate or split if exceeded
最低建议字符Min recommended chars10少于 10 字符时准确度下降,建议使用 hint_lang 辅助Accuracy drops below 10 chars; use hint_lang to assist
请求频率Rate limit120 次/分钟req/min按账号计算Per account
Top N 范围Top N range1 ~ 5超出自动截断为 5Auto-capped at 5 if exceeded

置信度解读

Confidence Interpretation

置信度范围Confidence Range可靠性Reliability建议Recommendation
≥ 0.90极高Very High可直接信任结果,无需人工复核Trust result directly; no manual review needed
0.70 ~ 0.90High基本可靠,建议查看 Top 3 候选确认Generally reliable; review top 3 candidates to confirm
0.50 ~ 0.70Medium文本可能过短或多语言混合,建议使用 hint_lang 重新检测Text may be too short or mixed; retry with hint_lang
< 0.50Low不确定,可能为罕见语言或无意义文本,需人工判断Uncertain; likely a rare language or nonsensical text; manual review required

错误码

Error Codes

HTTP Code错误码Error Code说明Description
2000成功Success
4001001参数错误,请检查必填参数和参数格式Invalid parameter; check required fields and format
4001010text 为空或无意义字符,无法检测Text is empty or meaningless; cannot detect
4001011min_confidence 参数超出 0~1 范围min_confidence out of 0~1 range
4001012top_n 参数超出 1~5 范围top_n out of 1~5 range
4001013hint_lang 不是有效的语言代码hint_lang is not a valid language code
4012001认证失败,Token 无效或已过期Authentication failed; invalid or expired token
4032003无权限访问该资源Access denied; insufficient permissions
4133001请求文本超出长度限制(最大 5,000 字符)Text exceeds maximum length (5,000 chars)
4294001请求频率超限,请稍后重试Rate limit exceeded; please retry later
5005001服务器内部错误,请重试或联系技术支持Internal server error; retry or contact support

最佳实践

Best Practices

建议Suggestion说明Description
提供足够长度的文本 Provide sufficient text 至少 10 个字符,50 个字符以上可获得最佳准确率。过短文本可能导致检测结果不稳定 At least 10 chars, 50+ for optimal accuracy. Very short text may lead to unstable results
利用 hint_lang 提升短文本检测 Use hint_lang for short text 处理短文本(<10 字符)或相似语言对(如 zh/ja、fi/et)时,通过 hint_lang 提供上下文可显著提升准确度 For short text (<10 chars) or similar language pairs (e.g. zh/ja, fi/et), providing hint_lang context significantly improves accuracy
返回 Top N 候选交叉验证 Return top N for cross-validation 将 top_n 设为 3~5,通过多个候选的置信度分布判断是否存在歧义,若首尾置信度接近则需要人工判断 Set top_n to 3-5; examine confidence distribution of candidates to detect ambiguity; if top and runner-up are close, manual review is needed
过滤低置信度结果 Filter low-confidence results 对准确度要求严格的场景设置 min_confidence=0.80,自动过滤掉不可靠的检测结果 Set min_confidence=0.80 for accuracy-critical scenarios to auto-filter unreliable results
结合书写系统信息判别 Combine with script detection 开启 return_script 获取书写系统信息,结合 script 与 language 交叉验证,区分使用相同书写系统的相似语言 Enable return_script to cross-validate script info with language detection, helping distinguish similar languages using the same script
纯文本输入,去除干扰信息 Provide clean text input 检测前移除 URL、邮箱、数字序列等非语言内容,可提高检测准确度 Remove URLs, emails, number sequences, and other non-linguistic content before detection for improved accuracy

应用场景

Use Cases

场景Scenario最佳方案Approach
翻译前的自动语言检测 Pre-translation auto-detection 将 source_lang 设为 auto,后台自动调用检测接口,用户无需手动选择源语言 Set source_lang to auto; detection runs automatically, no manual language selection needed
多语言内容分类 Multi-language content classification 对用户生成内容(评论、帖子、客服消息)进行批量语言检测,按语言路由到对应的处理流程 Batch detect language of user-generated content (comments, posts, support messages) and route by language
国际化搜索引擎 International search engine 检测搜索查询的语言,自动切换到对应语言的搜索索引和排序策略 Detect search query language to auto-switch to the appropriate language index and ranking strategy
代码仓库文档语言识别 Code repository doc detection 扫描仓库中的注释和文档文件,自动识别语言分布,规划国际化文档翻译优先级 Scan comments and docs in repos to auto-identify language distribution and prioritize i18n translation
社交媒体舆情监控 Social media monitoring 实时检测社交媒体流中的文本语言,按语言分类后交由对应分析师或翻译引擎处理 Real-time language detection of social media streams, routing to language-specific analysts or translation engines
OCR 后处理语言确认 Post-OCR language verification OCR 识别出的文本可能来源不明,通过检测接口确认后,再送入对应语言的翻译或纠错流程 OCR-extracted text may have unknown origin; confirm via detection before routing to language-specific translation or correction

与其他 API 组合使用

Combination with Other APIs

组合场景Combo Scenario使用方式Approach
语言检测 + 文本翻译 Detect + Translate 先检测源语言,再将结果作为 source_lang 传入文本翻译,适用于未知语言输入的场景 Detect source language first, then pass result as source_lang to Text Translation for unknown-language inputs
语言检测 + 语法纠错 Detect + Grammar 检测到具体语言和变体后,传入语法纠错,使引擎能选择该语言专属的纠错模型 After detecting language and variant, pass to Grammar Check for language-specific correction models
语言检测 + 图片翻译 Detect + Image Translate OCR 识别后的文本通过检测确认语言,再调用图片翻译完成翻译 Confirm OCR-detected text language via detection, then call Image Translation for full translation
语言检测 + 语种列表 Detect + Language List 先通过语种列表获取支持的语言代码,再传入检测获得的语言代码验证兼容性 Fetch supported language codes via Language List, then verify compatibility with detection results
使用说明
  • 所有 API 请求均使用 HTTPS,建议开启 HTTP Keep-Alive 以提高性能。
  • All API requests use HTTPS; enable HTTP Keep-Alive for better performance.
  • 请勿在客户端代码中暴露 Access Token,建议通过后端代理调用。
  • Do not expose your Access Token in client-side code; use a backend proxy.
  • 推荐设置合理的超时时间(30 秒),并实现指数退避重试策略。
  • Set a reasonable timeout (30s) and implement exponential backoff for retries.