OpenAI 发布 Astra 时出现罕见延迟,随后多次调整评测数据。Astra 幻觉率一度从 4.2% 降至 2%,后又恢复到 4.2%。GPT-5.6 Sol 的 ExploitBench 得分从 5.5% 调升至 11.5%,Anthropic 的 Fable 5.1 数学分数也曾被下调约 10 个百分点。OpenAI 表示,修改是为了更准确反映模型性能。Fortune🍀在花频道 @Zaihua8 📮投稿 @Zaihua8bott.me/zaihua88/3250TranslateSeptember 6, 2026 127