Skip to main content
Gemini 2.5 Flash Lite

Gemini 2.5 Flash Lite

Google 面向低延迟与高吞吐、成本敏感场景的 Gemini 模型。

低延迟高吞吐成本敏感

上下文窗口

1,048,576

Gemini 2.5 Flash Lite

最大输出

65,535

1M tokens

输入

$0.10

输出

$0.40

模型代码gemini-2.5-flash-lite

试玩区

gemini-2.5-flash-lite

暂无输出

定价

方案上下文窗口最大输出输入输出缓存写入缓存读取
Gemini 2.5 Flash Lite
1,048,57665,535
$0.10
$0.40
-
$0.01

这里展示的是 Vertex AI 按量计费下文本、图片、视频输入的官方价格。

音频输入单价为每 100 万 tokens $0.30,缓存音频输入为 $0.03。

缓存读取或缓存输入价格适用于复用的提示词 tokens。

README

Gemini 2.5 Flash Lite 是 Google 的轻量 2.5 系列模型,重点优化低延迟和更低成本,同时保留 Gemini 2.5 家族的多模态和工具使用基础能力。
  • Google 将 Gemini 2.5 Flash Lite 描述为为低延迟场景优化的平衡型模型。
  • 它保留了 Gemini 2.5 的关键能力,包括多模态输入、Google Search grounding、代码执行和 100 万 tokens 上下文。
  • 它非常适合高并发助手、模型路由层、后台自动化等更看重吞吐和成本而非极限推理深度的场景。

API

查看 API 文档以获取请求格式、参数说明和集成方式。

Google 面向低延迟与高吞吐、成本敏感场景的 Gemini 模型。

模型代码

gemini-2.5-flash-lite

查看 API 文档

API

端点

POST /v1beta/models/{model}:generateContent

认证

x-goog-api-key: YOUR_REACH_API_KEY
Content-Type: application/json

示例

curl -X POST "https://direct.reachapi.ai/v1beta/models/YOUR_MODEL_ID:generateContent" \
  -H "x-goog-api-key: YOUR_REACH_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [
      {
        "role": "user",
        "parts": [
          {
            "text": "Introduce ReachAPI in one sentence."
          }
        ]
      }
    ],
    "generationConfig": {
      "temperature": 0.2
    }
  }'