Gemini 2.5 Flash进入预览,可调思考预算平衡速度、成本与推理
4月17日,Google推出Gemini 2.5 Flash早期预览版,并通过Gemini API、Google AI Studio和Vertex AI向开发者开放。新模型在Gemini 2.0 Flash的速度基础上加强推理能力,主要面向需要低延迟、高频调用和成本控制的生产场景。
Gemini 2.5 Flash被Google称为首款“完全混合推理模型”。开发者可以开启或关闭思考过程,也可以设置思考预算,根据任务难度决定模型投入多少推理资源。简单分类和信息提取可以优先速度,复杂分析和多步骤任务则可以增加推理预算。
这种设计使模型不再只能在“快速回答”和“深度思考”之间二选一,而是根据业务需要调整质量、延迟和成本。不过,思考预算提高通常会增加输出Token和等待时间,企业应结合真实调用量记录单次任务成本和成功率。
Gemini 2.5 Flash同时进入Gemini应用,并可与Canvas等功能结合处理文档和代码。正式应用前,企业仍需测试长文档一致性、格式遵循、并发稳定性和错误恢复能力,避免只依据公开评测完成选型。
*本文为基于官方发布信息的中文摘要,详情以原文链接为准。