快速开始
在你的 Comfy 工作区中创建密钥,并将其导出为COMFY_API_KEY。Python 和 TypeScript 代码片段使用 Comfy SDK(pip install comfy-sdk、npm install @comfyorg/sdk);cURL 代码片段是通过原始 HTTP 发起的同一调用。
模型 ID: vertexai/gemini-3.1-flash-lite-image
端点: POST https://api.comfy.org/v2/models/vertexai/gemini-3.1-flash-lite-image
- Wait for the result
- Queue and collect later
Schema
Input
object[]
必填
与模型进行的当前对话的内容。对于单轮查询,这是单个实例。对于多轮查询,这是一个重复字段,包含对话历史和最新请求。
object[]
必填
object
基于 URI 的数据。
string
URI
string
data 或 fileUri 字段中指定的文件的媒体类型。可接受的值包括以下内容。对于 gemini-2.0-flash-lite 和 gemini-2.0-flash,音频文件的最大长度为 8.4 小时,视频文件(无音频)的最大长度为一小时。有关更多信息,请参阅 Gemini 音频和视频要求。文本文件必须采用 UTF-8 编码。文本文件的内容计入 token 限制。图像分辨率无限制。可能的值:
application/pdf、audio/mpeg、audio/mp3、audio/wav、image/png、image/jpeg、image/webp、text/plain、video/mov、video/mpeg、video/mp4、video/mpg、video/avi、video/wmv、video/mpegps、video/flv、image/heic、image/heif、audio/flac、video/webmobject
以内联原始字节形式提供的数据。对于 gemini-2.0-flash-lite 和 gemini-2.0-flash,使用 inlineData 最多可以指定 3000 张图像。
string (byte)
要在提示中内联包含的图像、PDF 或视频的 base64 编码。以内联方式包含媒体时,还必须指定数据的媒体类型(mimeType)。大小限制:20MB格式:
bytestring
data 或 fileUri 字段中指定的文件的媒体类型。可接受的值包括以下内容。对于 gemini-2.0-flash-lite 和 gemini-2.0-flash,音频文件的最大长度为 8.4 小时,视频文件(无音频)的最大长度为一小时。有关更多信息,请参阅 Gemini 音频和视频要求。文本文件必须采用 UTF-8 编码。文本文件的内容计入 token 限制。图像分辨率无限制。可能的值:
application/pdf、audio/mpeg、audio/mp3、audio/wav、image/png、image/jpeg、image/webp、text/plain、video/mov、video/mpeg、video/mp4、video/mpg、video/avi、video/wmv、video/mpegps、video/flv、image/heic、image/heif、audio/flac、video/webmstring
模型读取该部分视频的方式。设置为 “AGENTIC” 可让模型自行决定要检查的片段,而不是按固定速率采样帧。使用默认的固定速率采样时请省略。在 gemini-3.7-flash 及更新的 Flash 模型上受支持。
string
文本提示词或代码片段。
boolean
表示此部分为模型的思考/推理步骤。
string
可能的值:
user、modelobject
用于生成的采样、长度和输出设置。每个字段都是可选的:下面声明了
default 的字段在省略时会应用该默认值,其余字段则回退到模型自身的行为。object
图像生成配置
string
生成图像的宽高比
object
可选。生成图像的图像输出格式。
integer
可选。输出图像的压缩质量。
string
可选。输出图像应保存为的图像格式。
string
可选。指定生成图像的尺寸。支持的值为 1K、2K、4K。如果未指定,模型将使用默认值 1K。
integer
响应中可以生成的最大 token 数。一个 token 大约相当于 4 个字符。100 个 token 大约对应 60-80 个单词。范围:
16 到 65536`TEXT`, `IMAGE`[]
integer
当种子固定为某个特定值时,模型会尽力为重复的请求提供相同的响应。不保证输出具有确定性。此外,更改模型或参数设置(例如 temperature)可能会导致响应发生变化,即使使用相同的种子值也是如此。默认情况下使用随机种子值。适用于以下模型:gemini-2.5-flash、gemini-2.5-pro、gemini-2.5-flash-preview-04-1、gemini-2.5-pro-preview-05-0、gemini-2.0-flash-lite-00、gemini-2.0-flash-001
string[]
number
默认值:"1"
温度用于在响应生成期间进行采样,采样在应用 topP 和 topK 时发生。温度控制 token 选择过程中的随机程度。较低的温度适合需要较为收敛或不太发散的响应的提示,而较高的温度则可能带来更多样或更有创意的结果。温度为 0 表示始终选择概率最高的 token。在这种情况下,对于给定提示的响应基本是确定性的,但仍可能出现少量变化。如果模型返回的响应过于泛泛、过短,或者模型给出了兜底响应,请尝试提高温度范围:
0 至 2格式:floatobject
可选。思考功能的配置。思考是指模型将复杂任务拆解为更小的步骤,以生成更高质量响应的过程。
boolean
可选。如果为 true,模型将在响应中包含其思考内容。
integer
可选。模型思考过程的 token 预算。模型将尽力控制在该预算之内。
string
可选。模型的思考级别。可能的取值:
THINKING_LEVEL_UNSPECIFIED、LOW、MEDIUM、HIGH、MINIMALinteger
默认值:"40"
Top-K 改变模型为输出选择 token 的方式。top-K 为 1 表示下一个被选择的 token 是模型词表中所有 token 里概率最高的一个。top-K 为 3 表示下一个 token 将通过温度从概率最高的 3 个 token 中选出。范围:
1 至 …number
默认值:"0.95"
如果指定,将使用核采样。
Top-P 改变模型为输出选择 token 的方式。token 会从概率最高(见 top-K)到最低依次选择,直到它们的概率之和等于 top-P 值。例如,如果 token A、B、C 的概率分别为 0.3、0.2 和 0.1,且 top-P 值为 0.5,那么模型将通过温度从 A 或 B 中选择下一个 token,并将 C 排除在候选之外。
指定较低的值可获得随机性更低的响应,指定较高的值可获得随机性更高的响应。范围:
0 至 1格式:floatobject[]
用于阻止不安全内容的单次请求设置。在 GenerateContentResponse.candidates 上强制执行。
string
必填
可能的取值:
HARM_CATEGORY_SEXUALLY_EXPLICIT、HARM_CATEGORY_HATE_SPEECH、HARM_CATEGORY_HARASSMENT、HARM_CATEGORY_DANGEROUS_CONTENTstring
必填
可能的取值:
OFF、BLOCK_NONE、BLOCK_LOW_AND_ABOVE、BLOCK_MEDIUM_AND_ABOVE、BLOCK_ONLY_HIGHobject
用于引导模型以获得更好表现的指令。例如,“尽可能简洁地回答”或”不要在响应中使用技术术语”。这些文本字符串会计入 token 限制。systemInstruction 的 role 字段会被忽略,不影响模型的表现。注意:parts 中只应使用文本,且每个 part 中的内容应放在单独的段落中。
object[]
必填
构成单条消息的有序 parts 列表。不同的 part 可能具有不同的 IANA MIME 类型。有关输入的限制,例如最大 token 数或图像数量,请参阅 Google 模型页面上的模型规格。
string
文本提示或代码片段。
string
创建该消息的实体的身份。支持以下取值:user:表示该消息由真实的人发送,通常是用户生成的消息。model:表示该消息由模型生成。在多轮对话中,使用 model 值将来自模型的消息插入对话。对于非多轮对话,该字段可以留空或不设置。可能的取值:
user、modelobject[]
一段代码,使系统能够与外部系统交互,以执行超出模型知识和范围之外的一个或多个操作。请参阅函数调用。
object[]
string
string
必填
object
函数参数的 JSON schema
boolean
如果为 true,已生成的图像将上传到云端存储,并作为签名 URL 返回,而不是内联 base64 数据。这些 URL 将在 24 小时后过期。
object
对于视频输入,指视频在 Duration 格式下的起始和结束偏移量。例如,要指定从 1:00 开始的 10 秒片段,请设置 “startOffset”: { “seconds”: 60 } 和 “endOffset”: { “seconds”: 70 }。该元数据只应在视频数据以 inlineData 或 fileData 呈现时指定。
object
表示视频时间轴位置的时长偏移量。
integer
以纳秒精度表示的有符号秒数的小数部分。带小数部分的负秒值,其纳秒值仍必须为非负值。范围:
0 到 999999999integer
时间段的有符号秒数。必须在 -315,576,000,000 到 +315,576,000,000 之间(含边界)。范围:
-315576000000 到 315576000000object
表示视频时间轴位置的时长偏移量。
integer
以纳秒精度表示的有符号秒数的小数部分。带小数部分的负秒值,其纳秒值仍必须为非负值。范围:
0 到 999999999integer
时间段的有符号秒数。必须在 -315,576,000,000 到 +315,576,000,000 之间(含边界)。范围:
-315576000000 到 315576000000GET /v2/models/vertexai/gemini-3.1-flash-lite-image/openapi.json 提供的 schema,该文档也是请求到达提供商之前用于校验调用的同一份文档。
输出
object[]
object
object[]
string[]
integer
string
string (date)
格式:
dateinteger
string
string
object
与模型当前对话的内容。对于单轮查询,这是一个单一实例。对于多轮查询,这是一个重复字段,包含对话历史和最新请求。
object[]
必填
object
基于 URI 的数据。
string
URI
string
在 data 或 fileUri 字段中指定的文件的媒体类型。可接受的值包括以下内容。对于 gemini-2.0-flash-lite 和 gemini-2.0-flash,音频文件的最大长度为 8.4 小时,视频文件(不含音频)的最大长度为一小时。有关详细信息,请参阅 Gemini 音频和视频要求。文本文件必须采用 UTF-8 编码。文本文件的内容计入 token 限制。图像分辨率无限制。可能的值:
application/pdf、audio/mpeg、audio/mp3、audio/wav、image/png、image/jpeg、image/webp、text/plain、video/mov、video/mpeg、video/mp4、video/mpg、video/avi、video/wmv、video/mpegps、video/flv、image/heic、image/heif、audio/flac、video/webmobject
以原始字节形式提供的内联数据。对于 gemini-2.0-flash-lite 和 gemini-2.0-flash,使用 inlineData 最多可以指定 3000 个图像。
string (byte)
要在提示中内联包含的图像、PDF 或视频的 base64 编码。以内联方式包含媒体时,还必须指定数据的媒体类型(mimeType)。大小限制:20MB格式:
bytestring
在 data 或 fileUri 字段中指定的文件的媒体类型。可接受的值包括以下内容。对于 gemini-2.0-flash-lite 和 gemini-2.0-flash,音频文件的最大长度为 8.4 小时,视频文件(不含音频)的最大长度为一小时。有关详细信息,请参阅 Gemini 音频和视频要求。文本文件必须采用 UTF-8 编码。文本文件的内容计入 token 限制。图像分辨率无限制。可能的值:
application/pdf、audio/mpeg、audio/mp3、audio/wav、image/png、image/jpeg、image/webp、text/plain、video/mov、video/mpeg、video/mp4、video/mpg、video/avi、video/wmv、video/mpegps、video/flv、image/heic、image/heif、audio/flac、video/webmstring
模型读取该部分视频的方式。设置为 “AGENTIC” 可让模型自行决定要检查的片段,而不是按固定速率采样帧。使用默认的固定速率采样时请省略。在 gemini-3.7-flash 及更新的 Flash 模型上受支持。
string
文本提示或代码片段。
boolean
表示此部分是来自模型的思考/推理步骤。
string
可能的值:
user、modelstring
object[]
string
可能的值:
HARM_CATEGORY_SEXUALLY_EXPLICIT、HARM_CATEGORY_HATE_SPEECH、HARM_CATEGORY_HARASSMENT、HARM_CATEGORY_DANGEROUS_CONTENTstring
内容违反指定安全类别的概率可能的值:
NEGLIGIBLE、LOW、MEDIUM、HIGH、UNKNOWNstring
响应创建时的时间戳。
string
用于生成响应的模型版本。
object
string
string
object[]
string
可能的值:
HARM_CATEGORY_SEXUALLY_EXPLICIT、HARM_CATEGORY_HATE_SPEECH、HARM_CATEGORY_HARASSMENT、HARM_CATEGORY_DANGEROUS_CONTENTstring
内容违反指定安全类别的概率可能的值:
NEGLIGIBLE、LOW、MEDIUM、HIGH、UNKNOWNstring
响应的唯一标识符。
object
integer
仅限输出。输入中缓存部分(缓存内容)的 token 数量。
integer
响应中的 token 数量。
object[]
按模态划分的候选 token 明细。
string
输入或输出内容的模态类型。可能的值:
MODALITY_UNSPECIFIED、TEXT、IMAGE、VIDEO、AUDIO、DOCUMENTinteger
指定模态的 token 数量。
integer
请求中的 token 数量。当设置了 cachedContent 时,这仍是有效的提示词总大小,也就是说其中包含缓存内容中的 token 数量。
object[]
按模态划分的提示词 token 明细。
string
输入或输出内容的模态类型。可能的值:
MODALITY_UNSPECIFIED、TEXT、IMAGE、VIDEO、AUDIO、DOCUMENTinteger
指定模态的 token 数量。
integer
思考输出中存在的 token 数量。
integer
工具使用提示词中存在的 token 数量。
object[]
按模态细分的工具使用提示 token。
string
输入或输出内容模态的类型。可能的值:
MODALITY_UNSPECIFIED、TEXT、IMAGE、VIDEO、AUDIO、DOCUMENTinteger
给定模态的 token 数量。
integer
token 总数(提示词 + 候选)。
string
用于请求的流量类型(例如 PROVISIONED_THROUGHPUT)。
示例
输入
输出
inlineData.data 中包含 base64 字节,并在 inlineData.mimeType 中包含媒体类型。解码这些字节并将其保存到文件。使用 uploadImagesToStorage: true 时,上传的图像则通过 fileData.fileUri 提供签名 URL,并通过 fileData.mimeType 提供媒体类型。请在 URL 过期之前下载这些图像,即在创建后 24 小时内。上传失败会使该图像保持内联形式,因此需检查每个部分是 inlineData 还是 fileData;文本部分也可能出现,并且图像不保证是第一个部分。