小程序开放平台

文档中心
模型标准出入参
模型列表
文本模型
多模态(文生图&图片理解)
qwen-vl-max 的模型介绍
qwen3-vl-plus的模型介绍
多模态(文档模态DOC、PDF)
图片编辑&人像风格
(Beta)TTS语音合成

qwen3-vl-plus模型介绍

模型服务
>
模型列表
>
多模态(文生图&图片理解)
>
qwen3-vl-plus的模型介绍
>
更新时间:2026-02-05 16:47:58

模型介绍

视觉语言(Vision-Language)模型

Qwen3-VL-Plus 是通义千问 Qwen3-VL 系列中性能最强的视觉语言模型之一,专注于图像 + 文本联合理解与生成任务。支持图像问答、多学科题解、物体定位、文档解析、视觉编码等多模态任务;兼容语言与视觉的跨模态表达与多种语言,具备思考模式与非思考模式,以适应不同业务场景对推理过程与响应速度的需求。

适用场景

  • 多模态问答:图像 + 文本查询,如商品图鉴、自然场景问答。
  • 文档与票据处理:扫描件 OCR、表格识别、合同与发票内容结构化抽取。
  • 教育题解:图中数学题、物理化学题目即时解答。
  • 视觉定位:二维/三维定位,用于 AR/无人机/机器人场景。
  • 视觉与设计编码:将设计图、网站草图等转换为 HTML/CSS/JS 等代码。
  • 多语言支持与跨文化推广。

模型出入参

请求参数(入参)

字段名
字段类型
是否必传
字段默认值
字段说明
modelstring当前实例模型名模型名称,SDK 内部会自动设置为当前实例的
modelName
messages
Array<{ role: "system"|"user"|"assistant"; content: string | Array<{ type: "text"|"image"|"video"; text?: string; image?: string; video?: string }> }>
-对话消息数组,支持多轮对话,内容可包含图像、文本或视频
messages.role"system" | "user" | "assistant"-消息角色
messages.contentstring |
Array<{ type: "text"|"image"|"video"; text?: string; image?: string; video?: string }>
-文本内容或 multimodal 内容数组(问题、指令或上下文)
messages.content.type"text" | "image" | "video"-内容类型
messages.content.textstring可选-文本内容
messages.content.imagestring可选-图像 URL 或 Base64 字符串
messages.content.videostring可选-视频 URL 或 Base64 字符串
platform_tools
Array<object>
平台工具列表(函数/工具调用)
knowledge_base
Array<object>
知识库列表(检索增强)
enable_thinkingbooleanfalse控制是否开启思考模式(生成推理过程),思考模式更耗时但推理与解释更丰富
vl_high_resolution_imagesbooleanfalse控制是否启用高分辨率图像输入/输出,设为 true 时每张图像 token 上限可达 16384,提升细节感
min_pixelsinteger65536控制输入图像或视频帧最小像素数,防止太小导致识别困难
max_pixelsinteger1310720控制输入图像或视频帧最大像素数,防止太大导致资源消耗过高
total_pixelsinteger-视频场景中控制所有帧总像素量,以限制处理开销
temperaturenumber0.7控制文本生成的抽样多样性
top_pnumber0.9核采样参数
presence_penaltynumber1.5控制输出重复性与新颖性,例如提取文字任务里建议调整为 1.5
repetition_penaltynumber1.0重复惩罚参数

说明:

  • SDK 在发送请求前会合并默认值与入参;非流式时会强制
    stream=false
    ,流式时强制
    stream=true
  • 支持语言数量:33 种语言,包括中、日、韩、英、法、德、俄、西班牙语等。
  • 核心能力包括:文字识别/信息抽取、文档解析、对象定位(2D 与 3D)、视觉编码、图像/视频理解。
  • 输出控制:高分辨率模式开启后(设置
    vl_high_resolution_images=true
    ),每张图像 token 上限可达 16384;默认或关闭时数值较小。
  • 成本与延迟:思考模式与非思考模式存在性能与延迟差异,一般思考模式更耗时但是推理与解释更丰富。

响应参数(出参)

非流式响应(DoGenerateOutput,标准格式):

字段名
字段类型
是否必传
字段默认值
字段说明
idstring-请求/响应 ID
objectstring-对象类型,一般为
chat.completion
creatednumber-时间戳(秒)
modelstring-实际使用的模型名
log_idstring-日志跟踪 ID
errorstring""错误信息
codenumber0错误码
choices
Array<{ index: number; message: { id: string; role: "assistant"|"user"; type: string; content: string | Array<{ type: "text"|"image"; text?: string; image?: string }> }; finish_reason: string }>
-生成结果列表,根据任务类型返回相应结构化或文本形式的信息,可包含文本描述、分类标签、边界框/三维坐标等
usage{ prompt_tokens: number; completion_tokens: number; knowledge_tokens: number; reasoning_tokens: number; total_tokens: number; image_tokens?: number }-Token 统计信息,包括输入、输出 token 数、图像 token 数等,用于计费与限流

流式响应(BaseDoStreamOutputChunk,标准格式):

字段名
字段类型
是否必传
字段默认值
字段说明
idstring-同上
objectstring
chat.completion.chunk
流片段对象类型
creatednumber-时间戳(秒)
modelstring-模型名
log_idstring-日志跟踪 ID
errorstring""错误信息
codenumber0错误码
choices
Array<{ index: number; message: { id: string; role: "assistant"|"user"; type: string; content: string | Array<{ type: "text"|"image"; text?: string; image?: string }> }; finish_reason: string|null }>
-生成的增量内容
usage同上-一般在最后一个片段返回

使用示例

qwen3-vl-plus 基础 Agent 调用示例

下面示例展示了如何通过自定义 Agent 接入

qwen3-vl-plus
模型,实现图像理解 / 图文问答能力。

javascript
async sendMessage(message) {
  try {
    // 简单的参数校验
    if (!message?.files?.[0]?.url || !message?.msg) {
      return {
        code: -1,
        msg: '请上传图片并输入问题'
      };
    }

    // 创建 qwen3-vl-plus 模型
    const model = this.createModel('qwen3-vl-plus');
    const modelResponse = await model.streamText({
      messages: [
        {
          role: 'user',
          content: [
            {
              type: 'image_url',
              image_url: { url: message.files[0].url }
            },
            {
              type: 'text',
              text: message.msg
            }
          ],
        },
      ],
      enable_thinking: true
    });

    // 流式返回:分片为标准化的 text 类型
    for await (const chunk of modelResponse) {
      this.sseSender.send({ data: chunk });
    }
    this.sseSender.end();
  } catch (error) {
    console.error('qwen3-vl-plus stream error:', error);
    this.sseSender.end();
  }
}