蚂蚁百灵 Ling-3.0-flash-VL 接入官方 API,支持图片与短视频理解
蚂蚁百灵已在官方 API 参考文档中列出 Ling-3.0-flash-VL,配套多模态教程确认其能够接收文字、图片和视频。这让百灵的模型接口增加视觉输入路径,开发者可以把图片内容与文字问题放入同一个请求,并由模型结合图像作答;模型名称也已进入官方接口的可选值列表。
两类兼容接口的范围有所区别:OpenAI 兼容的 Chat Completions 接口支持文字、图片和视频,Anthropic 兼容的 Messages 接口支持文字与图片。官方文档分别提供请求示例,图片通过图像内容块提交,视频通过视频内容块提交,媒体数据使用 Base64 编码传入。接口还提供工具列表字段,可供应用声明函数调用能力。
图片输入接受 JPEG 和 PNG,单次请求最多四十张图片,请求体上限为三十二兆字节;单张图片编码后的字符串也有相同大小上限。视频输入接受 MP4、MOV 和 WMV,每次请求限一个,最长三十秒。官方设定视频采样频率为每秒两帧,每段视频最多采样三十二帧,因此三十秒时长上限与采样帧数上限需要同时遵守。
图像教程还规定单张图片总像素不得超过一万六千三百八十四乘七百八十四。图片细节参数由推理引擎使用默认值,不接受调用方通过该参数自行改变解析分辨率。
多模态教程:
https://developer.ant-ling.com/zh-CN/docs/tutorials/multimodal-understanding/
官方 API:
https://developer.ant-ling.com/zh-CN/docs/api-reference/openai/
September 5, 2026 388