
Gemini 2.5 Flash
在 UniRoute 上部署 Gemini 2.5 Flash API,实现经济高效的混合推理、可控思考以及可扩展的生产级性能。
Pricing
| Billing unit | UniRoute | Market |
|---|---|---|
| Input | $0.09 | $0.30 |
| Output | $0.75 | $2.50 |
per 1M tokens
About this model
Gemini 2.5 Flash API 提供了 Google 首个完全混合推理大语言模型,该模型专为在单个 LLM 中结合快速响应生成与可选的内部推理能力而设计。这种混合设计允许仅在任务需要时应用推理,使 Gemini 2.5 Flash API 无需切换模型或管道,即可支持低延迟请求和复杂的多步推理工作负载。
Deep dive
Gemini 2.5 Flash API:Google 首个混合推理 LLM
Gemini 2.5 Flash API 提供了 Google 首个完全混合推理大语言模型,该模型专为在单个 LLM 中结合快速响应生成与可选的内部推理能力而设计。这种混合设计允许仅在任务需要时应用推理,使 Gemini 2.5 Flash API 无需切换模型或管道,即可支持低延迟请求和复杂的多步推理工作负载。
Gemini 2.5 Flash API:百万级 Token 上下文架构
Gemini 2.5 Flash API 采用百万级 Token 上下文架构,单次请求支持高达 1,048,576 个输入 Token。这使得模型能够将整份文档、庞大的代码库、长对话及多模态数据集作为一个统一的上下文进行推理,而无需依赖过度分块 (Chunking) 或外部记忆系统。通过在上下文中完整保留长程信息,Gemini 2.5 Flash API 能为长上下文工作流提供更连贯的推理、更精准的交叉引用以及更可靠的输出结果。
Gemini 2.5 Flash API:多模态输入与结构化输出
Gemini 2.5 Flash API 支持文本、图像、视频和音频输入,并生成基于文本的结构化输出。借助内置的结构化输出支持,开发者可以设计出能够分析丰富多模态上下文并返回可预测、机器可读响应的工作流。这使得 Gemini 2.5 Flash API 成为兼顾复杂多模态理解与严格输出格式要求的理想选择。
Call it with one request
Works with the OpenAI SDK — just change the base URL.
curl https://api.uniroute.dev/v1/chat/completions \
-H "Authorization: Bearer $UNIROUTE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2.5-flash",
"messages": [{ "role": "user", "content": "Hello!" }],
"stream": true
}'Related models
NewGoogle 的高效 AI 模型,在编程、知识工作与智能体任务上兼具性能与成本优势。

在 UniRoute 基于 Google Gemini 3.5 Flash API 进行开发,实现智能体编程、多模态推理、长上下文分析、结构化输出及真实的 AI 产品工作流。

Google DeepMind 最新通用旗舰,深度推理 + 超长上下文。
