gpt-oss-safeguard开放,安全策略可在推理阶段灵活配置
10月29日,OpenAI发布gpt-oss-safeguard-120b和20b研究预览版。两款模型基于gpt-oss继续训练,并以Apache 2.0许可证开放权重。
与固定类别的传统审核模型不同,gpt-oss-safeguard在推理时同时接收政策文本和待分类内容,再根据开发者提供的规则判断风险,并输出结论与分析依据。
这种方式便于平台快速修改政策,适配游戏作弊、虚假评价或行业特定内容。但推理模型通常比简单分类器消耗更多计算资源,也可能在复杂政策下出现理解偏差。
企业应根据内容风险采用分层审核:小型分类器负责高频初筛,安全推理模型处理复杂边界案例,最终保留人工复核和申诉机制。
*本文为基于官方发布信息的中文摘要,详情以原文链接为准。