OpenAI发布o3与o4-mini,视觉推理与多工具协同成为新重点
4月16日,OpenAI发布推理模型o3和o4-mini。o3面向更复杂的综合推理任务,o4-mini则强调在数学、代码和视觉任务中的成本效率与高并发能力。两款模型同步进入ChatGPT和API,并支持根据任务需要使用网页搜索、Python、文件分析、图像生成等工具。
此次更新的一项重点是“结合图像进行推理”。模型不仅能够识别上传的白板、图表或手绘草图,还可以在分析过程中对图片进行裁切、缩放和旋转,再结合文字信息完成多步骤判断。这使视觉输入从单纯的识别对象,进一步进入模型的推理与工具链路。
OpenAI还强调,o3与o4-mini经过强化学习训练,能够判断何时调用工具,并根据工具返回结果继续调整方案。例如,模型可以先搜索公开资料,再编写代码进行计算,最后生成图表并解释结论。任务链条越长,错误也可能逐步累积,因此每一步来源与结果都需要保留。
对企业而言,o3更适合复杂分析、代码排错和多步骤规划,o4-mini则适合高频且需要推理的批量任务。涉及正式数据、客户承诺和业务操作时,仍应设置人工确认、工具权限和异常退出机制。