Gemini 2.5 Flash进入预览,可调思考预算平衡速度、成本与推理

发布时间:2025-04-17 分类:行业洞察 原文:查看原文 阅读:2分钟
Gemini 2.5 Flash进入预览,可调思考预算平衡速度、成本与推理

4月17日,Google推出Gemini 2.5 Flash早期预览版,并通过Gemini API、Google AI Studio和Vertex AI向开发者开放。新模型在Gemini 2.0 Flash的速度基础上加强推理能力,主要面向需要低延迟、高频调用和成本控制的生产场景。

Gemini 2.5 Flash被Google称为首款“完全混合推理模型”。开发者可以开启或关闭思考过程,也可以设置思考预算,根据任务难度决定模型投入多少推理资源。简单分类和信息提取可以优先速度,复杂分析和多步骤任务则可以增加推理预算。

这种设计使模型不再只能在“快速回答”和“深度思考”之间二选一,而是根据业务需要调整质量、延迟和成本。不过,思考预算提高通常会增加输出Token和等待时间,企业应结合真实调用量记录单次任务成本和成功率。

Gemini 2.5 Flash同时进入Gemini应用,并可与Canvas等功能结合处理文档和代码。正式应用前,企业仍需测试长文档一致性、格式遵循、并发稳定性和错误恢复能力,避免只依据公开评测完成选型。

*本文为基于官方发布信息的中文摘要,详情以原文链接为准。

获取适合企业发展的解决方案

围绕企业业务目标与组织需求,提供面向实际场景的产品与服务支持