UniRouteUniRoute
All models
Gemini 2.5 Flash
Text

Google

Gemini 2.5 Flash

在 UniRoute 上部署 Gemini 2.5 Flash API,实现经济高效的混合推理、可控思考以及可扩展的生产级性能。

Pricing

Billing unitUniRouteMarket
Input$0.09$0.30
Output$0.75$2.50

per 1M tokens

About this model

Gemini 2.5 Flash API 提供了 Google 首个完全混合推理大语言模型,该模型专为在单个 LLM 中结合快速响应生成与可选的内部推理能力而设计。这种混合设计允许仅在任务需要时应用推理,使 Gemini 2.5 Flash API 无需切换模型或管道,即可支持低延迟请求和复杂的多步推理工作负载。

Chat

Deep dive

Gemini 2.5 Flash API:Google 首个混合推理 LLM

Gemini 2.5 Flash API 提供了 Google 首个完全混合推理大语言模型,该模型专为在单个 LLM 中结合快速响应生成与可选的内部推理能力而设计。这种混合设计允许仅在任务需要时应用推理,使 Gemini 2.5 Flash API 无需切换模型或管道,即可支持低延迟请求和复杂的多步推理工作负载。

Gemini 2.5 Flash API:百万级 Token 上下文架构

Gemini 2.5 Flash API 采用百万级 Token 上下文架构,单次请求支持高达 1,048,576 个输入 Token。这使得模型能够将整份文档、庞大的代码库、长对话及多模态数据集作为一个统一的上下文进行推理,而无需依赖过度分块 (Chunking) 或外部记忆系统。通过在上下文中完整保留长程信息,Gemini 2.5 Flash API 能为长上下文工作流提供更连贯的推理、更精准的交叉引用以及更可靠的输出结果。

Gemini 2.5 Flash API:多模态输入与结构化输出

Gemini 2.5 Flash API 支持文本、图像、视频和音频输入,并生成基于文本的结构化输出。借助内置的结构化输出支持,开发者可以设计出能够分析丰富多模态上下文并返回可预测、机器可读响应的工作流。这使得 Gemini 2.5 Flash API 成为兼顾复杂多模态理解与严格输出格式要求的理想选择。

Call it with one request

Works with the OpenAI SDK — just change the base URL.

api.uniroute.dev
curl https://api.uniroute.dev/v1/chat/completions \
  -H "Authorization: Bearer $UNIROUTE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-2.5-flash",
    "messages": [{ "role": "user", "content": "Hello!" }],
    "stream": true
  }'

Related models