模型名称 | model(调用参数) | 能力支持 | 上下文窗口 (Token) | 最大输入 (Token) | 最大输出 (Token) |
Hy4 preview | hy4-preview | 深度思考(保留式思考) 结构化输出 Function Calling Cache 缓存 | 1M | 960k | 64k |
Hy3 | hy3 | 深度思考(保留式思考) 结构化输出 Function Calling Cache 缓存 | 256k | 192k | 128k |
DeepSeek-V4.1-Flash 原厂直供 | deepseek/deepseek-flash | 深度思考 结构化输出 Function Calling Cache 缓存 图片理解 | 1M | 1M | 384k |
DeepSeek-V4-Flash 原厂直供 | deepseek-v4-flash-202605 deepseek/deepseek-v4-flash-0731 deepseek/deepseek-v4-flash | 深度思考 结构化输出 Function Calling Cache 缓存 | 1M | 1M | 384k |
DeepSeek-V4-Pro 原厂直供 | deepseek-v4-pro-202606 deepseek/deepseek-v4-pro-0813 deepseek/deepseek-v4-pro | 深度思考 结构化输出 Function Calling Cache 缓存 | 1M | 1M | 384k |
DeepSeek-V4-Flash-Vision-Exp 原厂直供 | deepseek/deepseek-v4-flash-vision-exp | 深度思考 结构化输出 Function Calling Cache 缓存 | 1M | 1M | 384k |
DeepSeek-V4-Flash 0731 正式版 | deepseek-v4-flash-0731 | 深度思考 结构化输出 Function Calling Cache 缓存 | 1M | 1M | 384k |
DeepSeek-V4-Pro 0813 正式版 | deepseek-v4-pro-0813 | 深度思考 结构化输出 Function Calling Cache 缓存 | 1M | 1M | 384k |
DeepSeek-V4-Flash | deepseek-v4-flash | 深度思考 结构化输出 Function Calling Cache 缓存 | 1M | 1M | 384k |
DeepSeek-V4-Pro | deepseek-v4-pro | 深度思考 结构化输出 Function Calling Cache 缓存 | 1M | 1M | 384k |
Deepseek-v3.2 | deepseek-v3.2 | 深度思考 结构化输出 Function Calling | 128k | 96k | 32k |
GLM-5.3-FlashX | glm-5.3-flashx | 深度思考 结构化输出 Function Calling Cache 缓存 图片、视频理解 | 1M | 1M | 128k |
GLM-5.3-Flash | glm-5.3-flash | 深度思考 结构化输出 Function Calling Cache 缓存 图片、视频理解 | 1M | 1M | 128k |
GLM-5.3 | glm-5.3 | 深度思考 结构化输出 Function Calling Cache 缓存 | 1M | 1M | 128k |
GLM-5.2 | glm-5.2 | 深度思考 结构化输出 Function Calling Cache 缓存 | 1M | 1M | 128k |
GLM-5 (2026-10-08下线) | glm-5 | 深度思考 Function Calling Cache 缓存 | 200k | 200k | 128k |
GLM-5-Turbo (2026-10-08下线) | glm-5-turbo | 深度思考 结构化输出 Function Calling Cache 缓存 | 200k | 200k | 128k |
GLM-5V-Turbo (2026-10-30下线) | glm-5v-turbo | 深度思考 结构化输出 Function Calling Cache 缓存 | 200k | 200k | 128k |
GLM-5.1 (2026-10-08下线) | glm-5.1 | 深度思考 结构化输出 Function Calling Cache 缓存 | 200k | 200k | 128k |
Kimi K3 | kimi-k3 | 深度思考 结构化输出 Function Calling Cache 缓存 | 1m | 1m | 1m |
Kimi K2.8 Preview | kimi-k2.8-preview | 深度思考 结构化输出 Function Calling Cache 缓存 | 1m | 1m | 1m |
Kimi K2.7 Code HighSpeed | kimi-k2.7-code-highspeed | 深度思考 结构化输出 Function Calling Cache 缓存 | 256k | 256k | 256k |
Kimi K2.7 Code | kimi-k2.7-code | 深度思考 结构化输出 Function Calling Cache 缓存 | 256k | 256k | 256k |
Kimi-K2.6 | kimi-k2.6 | 深度思考 结构化输出 Function Calling Cache 缓存 | 256k | 256k | 256k |
Kimi-K2.5 | kimi-k2.5 | 深度思考 结构化输出 Function Calling Cache 缓存 | 256k | 224k | 16k |
MiniMax-M3 | minimax-m3 | 深度思考 Function Calling Cache 缓存 | 1M | 1M | - |
MiniMax-M2.5 | minimax-m2.5 | 深度思考 Function Calling Cache 缓存 | 200k | 200k | 128k |
MiniMax-M2.7 | minimax-m2.7 | 深度思考 Function Calling Cache 缓存 | 200k | 200k | 128k |
Hy-MT2-Pro | hy-mt2-pro | 混元翻译旗舰模型,适合专业领域等对译文质量要求高的场景 | 8k | 4k | 4k |
Hy-MT2-Plus | hy-mt2-plus | 翻译模型 翻译效果领先,有优秀的指令遵循能力 | 8k | 4k | 4k |
Hy-MT2-Lite | hy-mt2-lite | 混元翻译轻量级模型,适合对耗时有高要求的场景 | 8k | 4k | 4k |
MiMo-V2.5-Pro | mimo-v2.5-pro | 深度思考 结构化输出 Function Calling Cache 缓存 | 1M | 1M | 128k |
模型名称 | model(调用参数) | 模型介绍 | 输出维度 | 上下文窗口(Token) |
Kinfra-Text-Embedding-0.6b | kinfra-text-embedding-0.6b | 轻量文本向量模型,适合大规模文本召回、延迟敏感、成本敏感场景。 | 1024 | 32k |
Kinfra-Text-Embedding-4b | kinfra-text-embedding-4b | 高质量文本向量模型,适合高质量文本检索、深层语义理解场景。 | 2560 | 32k |
Kinfra-VL-Embedding-2b | kinfra-vl-embedding-2b | 轻量多模态向量模型,支持文本、图片、视频输入,适合多模态在线检索、视频检索、响应速度优先场景。 | 2048 | 32k |
Kinfra-VL-Embedding-8b | kinfra-vl-embedding-8b | 高精度多模态向量模型,支持文本、图片、视频输入,适合高精度多模态检索、精度优先场景。 | 4096 | 32k |
模型名称 | model(调用参数) | 模型介绍 | 任务类型 | 默认并发数 |
Hy-Image-3.0 | hy-image-v3 | 混元 Image-3.0 生图模型,能够去思考图像的布局、构图、笔触,利用世界知识去推理常识性的画面。同时可以解析千字级别的复杂语义,生成长文本文字、复杂漫画、表情包,还能生成生动有趣的科普插画。 | 文生图 图生图 | 5 |
WAND-Vega-Image1.0 Lite | wand-vega-image-lite | WAND-Vega-Image1.0 Lite 生图模型,成本更低、生成速度更快,适合电商商品图、批量素材等大规模生成场景,在可控预算下快速产出可用图像。 | 文生图 图生图 | 5 |
WAND-Vega-Image1.0 Flash | wand-vega-image-flash | WAND-Vega-Image1.0 Flash 生图模型,生成速度与画面质量均衡,适合短视频封面、社交媒体配图、营销物料等日常创作场景,兼顾效率与效果。 | 文生图 图生图 | 5 |
WAND-Vega-Image1.0 Pro | wand-vega-image-pro | WAND-Vega-Image1.0 Pro 生图模型,画质优先、细节表现更精,适合品牌视觉、精修主图、高质量设计素材等专业创作场景,稳定产出精细图像。 | 文生图 图生图 | 5 |
Kling-Image-v3 | kling-image-v3 | 利用参考图片对单张图像进行精确编辑与修改,兼具高画质与通用创作能力。 | 文生图 图生图 | 5 |
Kling-Image-o1 | kling-image-o1 | 仅通过提示词即可实现文生图和图生图等多种基础能力,侧重于对基础文本逻辑的理解与快速生成。 | 文生图 图生图 | 5 |
Kling-Image-v3-omni | kling-image-v3-omni | AI 图像叙事和跨模态融合上表现更优,能够深度优化图文生成逻辑,非常适合电影级或复杂视觉场景的图像创。 | 文生图 图生图 | 5 |
Seedream-Image-v5.0-pro | Seedream-Image-v5.0-pro | Seedream-5.0-pro模型将图像创作推进到可控生产的新阶段,主要亮点是编辑更可控、生产更落地、效果更自然。 | 文生图 图生图 | 5 |
Seedream-Image-v5.0-lite | Seedream-Image-v5.0-lite | 轻量快速的 Seedream 5.0 入门版,首次搭载联网实时检索,兼具精准编辑与逻辑推理能力,适合热点时效内容、复杂指令和高并发低成本的生产场景。 | 文生图 图生图 | 5 |
Vidu-Image-q2 | vidu-image-q2 | 支持参考生图、文生图、图片编辑,对中英文字的精准渲染、UI/图表等设计细节的像素级还原,适合制作海报、信息图等。 | 文生图 图生图 | 5 |
模型名称 | model(调用参数) | 模型介绍 | 任务类型 | 默认并发数 |
MiniMax-Video-H3-Max | minimax-video-h3-max | MiniMax H3 Max,多模态视频生成模型,音频与画面单次生成,支持首尾帧控制与角色一致性保持,5 秒片段秒级出片。 | 文生视频 图生视频 | 5 |
MiniMax-Video-H3 | minimax-video-h3 | 原生多模态理解与生成:支持文字、图片、音频、视频多种输入输出,完成一体化内容创作; 多模态精准编辑与控制:支持替换、参考等细节修改,让内容调整更可控; 商用级多场景内容生成:覆盖影视、广告、游戏、品牌、电商等高频场景,支持内容生产交付。 | 文生视频 图生视频 参考生视频 | 5 |
Kling-Video-motion-control-v3.0 | kling-video-motion-control-v3.0 | 可灵v2.6精准动作控制与姿态迁移模型,将参考视频中的动作、手势或面部表情精确迁移到静态的角色图像上。 | 动作控制 | 5 |
Kling-Video-motion-control-v2.6 | kling-video-motion-control-v2.6 | 可灵v3.0精准动作控制与姿态迁移模型,显著增强了复杂、多角度以及长达数秒动作中的面部特征稳定性与表情自然度。 | 动作控制 | 5 |
Kling-Video-V3 | kling-video-v3 | 可灵 V3 生视频模型,支持智能分镜与15秒长视频生成,最高4K Ultra 画质输出,可实现场景切换与连续叙事,适用于企业广告营销与专业影视创作。 | 文生视频 图生视频 | 5 |
Kling-Video-V3-omni | kling-video-v3-omni | Kling 3.0 Omni 是可灵 3.0 系列的全能多模态视频模型,支持文本、图片、视频等输入,具备角色语音驱动、原生音频输出和分镜叙事能力,适合复杂故事化视频、多主体一致性和音画同步创作。 | 文生视频 图生视频 参考生视频 | 5 |
Kling-Video-V3-turbo | kling-video-v3-turbo | 可灵 3.0 系列的高性价比快速版本,支持文本和图片输入,在保持稳定生成效果的同时提升生成效率,适合快速出片、营销短片、创意预览和成本敏感的视频生产场景。 | 文生视频 图生视频 | 5 |
PixVerse-Video-v6 | pixverse-video-v6.0 | 支持电影级摄像机控制、原生音频生成与多镜头连续输出,适用于专业影视创作与高品质广告制作。 | 文生视频 图生视频 | 5 |
PixVerse-Video-c1 | pixverse-video-c1 | 面向影视行业深度优化,支持文本、图像、首尾帧及多宫格分镜参考等多模态输入,可直出15秒1080P 音画同步视频,具备工业级动作表现与影视级特效渲染能力,适用于短剧、动漫、仙侠特效与影视前期分镜制作场景。 | 文生视频 图生视频 | 5 |
Hy-Video-v1.5 | hy-video-v1.5 | 支持文本、图像多模态输入生成高清视频,可实现场景切换与多角色交互,简化制作流程、降低成本,应用于企业广告营销与个人创意落地场景。 | 文生视频 图生视频 | 5 |
模型名称 | model(调用参数) | 模型介绍 | 任务类型 | 默认并发数 |
Hy-World-2.1-panorama | hy-world2-panorama | 混元世界模型 360 度全景图生成。输入一段文字或一张图片,模型即可合成高保真的 360 °全景图。 | 文生全景图 图生全景图 | 1 |
Hy-World-2.1-scene | hy-world2-scene | 混元世界模型3D场景生成,输入一段文字或一张图片,模型即可合成高保真、可漫游的 3DGS/Mesh 场景。生成的世界支持自由行走与物理碰撞,可无缝对接创作引擎。 | 文生3D场景 图生3D场景 | 1 |
模型名称 | model(调用参数) | 模型介绍 | 任务类型 | 默认并发数 |
Mureka-Music-v9 | mureka-music-v9 | 昆仑万维音乐生成模型,对曲风、情绪、人声及乐器编配拥有较高的控制率和还原度。 | 音乐生成 | 5 |
IndexTTS-2 | indextts-2 | IndexTTS-2 是由哔哩哔哩开源的工业级、情感与时长可控的自回归零样本语音克隆模型。 | 语音合成 | 5 |
WAND-Dubbing-STS-v1 | wand-dubbing-sts-v1 | WAND-Dubbing-STS-v1 是一款语音音色转换模型,它在完整保留原始语音内容的前提下,把说话人的音色换成指定声线:不改对白内容,保留原始语速、停顿与情绪表演,仅替换音色。适用于短视频变声玩法、角色声线统一,以及素材重制等场景。 | AI配音 | 5 |
文档反馈