Skip to content
登录/注册

Gemini 3.1 Flash Lite Preview

gemini-3.1-flash-lite-preview

Gemini 3.1 Flash Lite Preview 是 Google 针对大容量用例进行优化的高效模型。它在整体质量上优于 Gemini 2.5 Flash Lite,并在关键功能方面接近 Gemini 2.5 Flash 性能。改进涵盖音频输入/ASR、RAG 片段排名、翻译、数据提取和代码完成。支持完整的思维级别(最低、低、中、高)以实现细粒度的成本/性能权衡。价格仅为 Gemini 3 Flash 成本的一半。

上下文窗口1.0M
提供商Gemini
创建时间2026/04/30

在线体验

定价

同一模型能力,多条服务通道;按延迟、稳定性与成本灵活选择。

价格单位:$ / 1M tokens
指定服务通道:在请求体加入 provider 字段,例如 "provider": { "channel": "direct" }。可选 direct / stable / economical;不传则使用默认通道。

直连通道

官方直连链路,适合需要原生体验与完整上下文的请求。

输入输出缓存命中缓存写入
0.25/M1.50/M0.03/M0.08/M

介绍

输入
文本 图像
输出
文本

Gemini 3.1 Flash Lite Preview API:面向大容量场景的高效模型

Gemini 3.1 Flash Lite Preview 是 Google 针对大容量用例优化的高效模型。它在整体质量上优于 Gemini 2.5 Flash Lite,并在关键能力上接近 Gemini 2.5 Flash 的水平——改进覆盖音频输入与 ASR、RAG 片段排序、翻译、数据提取和代码补全。

它的定位很清楚:当你的调用量大到让旗舰模型在经济上不可行时,Flash Lite 是那个"依然能用、而且用得起"的选择。配合 100 万 token 上下文窗口,它在长文档预处理这类场景上性价比尤其突出。

海鲸AI 通过 OpenAI 兼容接口提供 Gemini 3.1 Flash Lite Preview,支持工具调用、流式输出与多模态输入。

获取 API 密钥 · 模型 ID:gemini-3.1-flash-lite-preview


为什么选择 Gemini 3.1 Flash Lite Preview

  • 大容量场景的经济选择 —— 高频调用下的成本控制核心
  • 整体质量优于 2.5 Flash Lite —— 关键能力接近 2.5 Flash
  • 100 万 token 上下文 —— 轻量档位同样支持超长输入
  • 支持完整思维档位 —— 需要时可上调思考深度
  • 多模态输入 —— 文本与图像统一处理

核心能力

01 音频输入与语音识别

Flash Lite 在音频输入和 ASR(自动语音识别)上相比上一代有明显改进,适合大规模的语音转写和音频内容处理管线。

  • 语音转文字与转写
  • 音频内容理解
  • 会议、客服录音批量处理

02 RAG 片段排序

在检索增强生成管线中,Flash Lite 适合承担召回结果的重排序工作——把最相关的片段挑出来交给更强的模型,显著降低整体成本。

  • 检索结果相关性排序
  • 片段筛选与裁剪
  • RAG 管线的成本优化层

03 翻译与数据提取

翻译质量和结构化数据提取是这一代改进的重点,适合大批量的多语言内容处理和非结构化数据转换。

  • 多语言翻译
  • 表单与文档字段提取
  • 结构化 JSON 输出

04 代码补全

代码补全能力的改进让它可以承担 IDE 内联补全这类高频、低延迟要求的场景。

  • IDE 内联代码补全
  • 代码片段生成
  • 语法与格式修正

最佳使用场景

场景 说明
大批量转写 音频/语音的规模化转文字
RAG 重排序 检索结果的相关性打分与筛选
多语言翻译 大规模内容本地化
数据提取 非结构化文本转结构化字段
代码补全 IDE 内联补全等低延迟场景
长文档预处理 100 万 token 窗口内的低成本摘要

Gemini 3.1 Flash Lite 与 Gemini 3.5 Flash、3 Flash 的差异

能力 Gemini 3.1 Flash Lite Gemini 3 Flash Preview Gemini 3.5 Flash
模型 ID gemini-3.1-flash-lite-preview gemini-3-flash-preview gemini-3.5-flash
定位 大容量经济档 快速通用档 高效多模态主力
上下文窗口 约 105 万 token 约 105 万 token 10.5 万 token
最大输出 65.5K token 65.5K token 64K token
侧重 ASR、排序、翻译、抽取 通用快速响应 编码与并行智能体
相对成本 最低 低 中

具体计费以页面上方的实时价格卡片为准。


如何使用 Gemini 3.1 Flash Lite Preview API

1. 创建海鲸AI API 密钥 在控制台生成密钥并充值。

2. 用它做管线的第一层 典型做法是让 Flash Lite 承担筛选、排序、抽取这类前置工作,把精炼后的内容交给更强的模型做最终推理。

3. 调用接口

curl -X POST https://api.haijingai.com/v1/chat/completions \
  -H 'Authorization: Bearer YOUR_API_KEY' \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "gemini-3.1-flash-lite-preview",
    "messages": [
      {"role": "user", "content": "从下面 20 段检索结果中挑出与问题最相关的 3 段,只输出编号。"}
    ]
  }'

常见问题

它比 2.5 Flash Lite 强多少? 整体质量优于 2.5 Flash Lite,在关键能力上接近 2.5 Flash 的水平。改进集中在音频输入/ASR、RAG 片段排序、翻译、数据提取和代码补全上。

上下文窗口多大? 约 105 万 token,是轻量档位中上下文最充裕的选择之一,长文档预处理场景很划算。

支持思考吗? 支持完整的思维档位设置,可以按任务难度上调或下调思考深度。

适合做 RAG 管线的哪一层? 最适合做重排序和筛选层。用它把召回结果精炼后交给更强的模型,能显著降低整体成本。

支持音频输入吗? 上游模型支持音频输入与 ASR,具体可用性以平台接口说明为准。

Preview 意味着什么? 表示这是预览版本,能力和接口可能随上游更新调整。生产使用前建议做好版本变更的应对预案。


为什么选择海鲸AI 使用 Gemini 3.1 Flash Lite API

  • 国内直连 —— 无需 Google Cloud 账户和海外网络
  • OpenAI 兼容接口 —— 现有代码改两行接入
  • 分层管线友好 —— 与 Gemini 3.5 Flash、Pro 档位共用密钥,按环节路由
  • 统一用量看板 —— 大批量调用的花费集中查看

API

API 接入信息 ​

Model ID在推理接口中指定模型
gemini-3.1-flash-lite-preview
API Key推理接口的 Bearer Token(鉴权令牌)
Base URL兼容 OpenAI 协议 · /chat/completions
OpenAIhttps://api.haijingai.com/v2/
provider 可选指定服务通道,不传则由系统选择默认通道
"provider": { "channel": "direct" }

gemini-3.1-flash-lite-preview 接入示例 ​

海鲸AI 兼容 OpenAI 接口协议,可直接使用 OpenAI SDK 或 HTTP 请求接入,默认开启流式输出。

js
curl https://api.haijingai.com/v2/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer <API_KEY>" \
  -d '{
    "model": "gemini-3.1-flash-lite-preview",
    "messages": [
      {"role": "system", "content": "你是一个有帮助的助手。"},
      {"role": "user", "content": "你好!"}
    ],
    "provider": { "channel": "direct" },
    "stream": true
  }'
# provider 为可选字段,删除该行即使用默认通道
js
from openai import OpenAI

client = OpenAI(
    base_url="https://api.haijingai.com/v2",
    api_key="<API_KEY>",
)

stream = client.chat.completions.create(
    model="gemini-3.1-flash-lite-preview",
    messages=[
        {"role": "system", "content": "你是一个有帮助的助手。"},
        {"role": "user", "content": "你好!"},
    ],
    stream=True,
    # 可选:指定服务通道,不传则使用默认通道
    extra_body={"provider": {"channel": "direct"}},
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)
js
import OpenAI from 'openai'

const client = new OpenAI({
  baseURL: 'https://api.haijingai.com/v2',
  apiKey: '<API_KEY>',
})

const stream = await client.chat.completions.create({
  model: 'gemini-3.1-flash-lite-preview',
  messages: [
    { role: 'system', content: '你是一个有帮助的助手。' },
    { role: 'user', content: '你好!' },
  ],
  stream: true,
  // 可选:指定服务通道,不传则使用默认通道
  // @ts-expect-error provider 为海鲸AI 扩展字段,不在 OpenAI SDK 类型定义内
  provider: { channel: 'direct' },
})

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0]?.delta?.content ?? '')
}
联系客服