All models

gemini-3.5-flash-lite

GoogleChatreasoningvision
Input 0.6307 Credits / 1MOutput 5.2562 Credits / 1M
Get your API key
gemini-3.5-flash-lite

面向高频文档解析与轻量代理的多模态模型

Gemini 3.5 Flash-Lite 是 Google 面向低延迟、成本敏感任务设计的多模态模型,重点处理文档解析、简单数据提取和职责明确的子代理任务。它兼具长输入处理、图像理解、思考与结构化输出能力,适合把大量重复工作整理成可用数据,而不是把每次请求都变成长链条的深度分析。

Google模型品牌
对话模型类型
推理、视觉理解任务能力

规格与接口特性

在选型前明确容量、输入输出与调用方式。

原生输入上限
1,048,576 tokens
原生输出上限
65,536 tokens
原生输入与输出
文本、图像、视频、音频、PDF 输入;文本输出
原生任务能力
Thinking、函数调用、结构化输出、缓存
图文调用方式
messages 中组合 text 与 image_url;支持流式响应
文件与连续会话
会话入口支持 file_url、stateful 与会话 id

原生规格描述模型能力;本平台的图文请求与文件会话分别使用对应入口,容量数字不代表每次请求的可用额度。

核心能力

了解 gemini-3.5-flash-lite 能为你的工作带来什么。

把长材料变成明确字段

Flash-Lite 针对文档解析和简单提取优化,可将报告、记录或说明文本整理为字段、分类和摘要。任务中写清字段定义、缺失值规则与输出格式,比笼统要求全面分析更贴合它的定位;需要机器消费结果时,可结合结构化输出并做类型校验。

图文一起理解,结果仍是文本

它能结合文字指令理解图片,适合从截图、表单或图表中提取指定信息。图文请求将 text 与 image_url 放入同一内容数组,让问题和视觉材料保持对应。交付物可以是解释或结构化文本,但不会直接生成图片,也不会把答案合成为语音。

承担职责清晰的子代理工作

原生函数调用与思考能力让它可以承担信息核对、参数整理等聚焦任务。设计工作流时,应给出工具用途、必填参数和完成条件,把复杂目标拆成可检查步骤。函数调用表达的是操作意图,实际执行仍需要应用或已配置工具完成。

适用场景

从具体任务出发,找到模型发挥作用的位置。

客服记录分类与整理

输入客服对话或工单文本,要求按既定标签判断问题类型,并提取产品、诉求与待补充信息,交付统一字段的记录。对缺少依据的标签允许返回待确认,再由人工复核疑难项,适合将高频、重复的整理工作嵌入业务流程。

文档与表单信息入库

输入文档文本、表单图片,或通过会话入口提供文件链接,指定需要的名称、日期、金额及对应原文,生成便于入库的结构化结果。先限定提取范围,再检查字段完整性与原文对应关系,避免让摘要内容替代精确的数据记录。

围绕材料持续追问

先提交材料并生成重点摘要,再围绕同一材料追问差异、条目或遗漏信息。使用会话入口可保存返回的 id 延续讨论;已有自建聊天系统则可通过 messages 携带历史。最终交付可包含摘要、问题清单和需要进一步确认的事项。

如何选择这个模型

结合任务复杂度、输入材料与预期结果选择。

常规整理优先 Lite,难题另作评估

当任务是分类、简单提取、文档解析或范围明确的子代理工作,Flash-Lite 的低延迟、成本友好定位更合适。若需求转向复杂编码、长链条推理或持续自主执行,可将完整 Flash 或 Pro 纳入比较。用同一组样本评估字段正确率、任务完成率和返工量,而不是仅凭系列名称选型。

区分型号,也区分工作流

gemini-3.5-flash-lite 与 gemini-3.5-flash、gemini-3.1-flash-lite 是不同型号,不能将它们视作拼写别名。直接管理历史、输出格式和工具回填时,选择 Chat Completions;需要保存会话、提交文件链接和管理对话时,选择会话入口。迁移既有应用时,保留代表性样本检查结果。

开始使用

从一次小规模任务到正式接入。

01

准备任务与材料

明确目标、必要输入与输出要求,使用真实业务样例作为起点。

02

在 API 调试区试用

打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。

03

按 API 文档接入

保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。

使用边界

在正式使用前,了解输出质量与能力范围。

  • 长输入容量不等于每段材料都能被同样准确地提取。对跨文档字段、相似名称和分散条目,应要求附带对应原文;过长且无关的材料也会增加处理负担,优先保留任务所需内容,必要时拆分后汇总。
  • 这是理解与文本输出模型,不支持原生图像生成、音频生成或 Live API。原生能理解视频和音频,不意味着可以把任意媒体链接放进图片字段;文件任务应使用适合的提交方式,避免混用不同内容类型。
  • 轻量子代理不应被当作无人监督的完整执行系统。多步任务需要检查工具是否实际完成、返回结果是否有效以及停止条件是否满足;涉及写入、发送或发布时,应设置明确权限,并保留失败后的确认与恢复步骤。

常见问题

解答使用 gemini-3.5-flash-lite 时的常见疑问。

Gemini 3.5 Flash-Lite 和 3.5 Flash 是同一个模型吗?

不是。Flash-Lite 重点面向低延迟、成本敏感的文档解析、提取和轻量子代理任务,不能把 3.5 Flash 的配置直接沿用到 Lite。调用时使用 gemini-3.5-flash-lite,迁移后应重新检查输出质量与任务完成情况。

怎样让它返回方便程序处理的 JSON?

在提示中明确要求仅返回 JSON,并写清字段含义、必填项、枚举和缺失值规则,可附上预期输出示例。模型原生支持结构化输出;若使用 response_format 配置 JSON 对象或 JSON Schema,需以该入口对本型号实际支持的配置为准。收到结果后仍需解析并校验字段,尤其要区分格式正确与内容确实有材料依据。

分析 PDF 应该使用哪个入口?

文件会话可使用 /aichat2/conversations,在 message 中提供 file_url 和任务说明。Chat Completions 的图文内容使用 text 与 image_url,不应把 PDF 当作图片提交;也可先提取文本,再交给模型进行分类、摘要或字段整理。

支持看图,也能生成图片或朗读回答吗?

它支持图像理解,可以根据图片回答问题或提取信息,但原生输出为文本,不支持图像生成或音频生成。图片可随文字指令一起提交;如果最终需要图片或语音作品,应将文本结果交给相应的生成服务处理。

连续追问时需要自己保存全部历史吗?

使用 /gemini/chat/completions 时,通过 messages 提供需要保留的对话历史。使用 /aichat2/conversations 时,可开启 stateful,并在后续请求中带回会话 id。前者便于精细控制上下文,后者适合托管连续会话。

模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。

把 gemini-3.5-flash-lite 用到你的下一项任务

从清晰的目标开始,在实际结果中判断它是否适合你的工作。