AI开发

⚠️🤖「Claude变笨的最根本原因」

NEWS #NEWS / Anthropic / ClaudeCode

官方承认变笨!Anthropic 今日发布技术事故复盘,正式向被 Claude 逼疯的开发者致歉。 过去一个月,大量用户投诉 Claude 响应质量严重下滑。 调查发现罪魁祸首竟是团队自己:3 月 4 日为了减少高推理模式(high effort)带来的延迟,开发团队在未充分测试的情况下,将默认推理 effort 从 high 降到了 medium。 这一改动直接导致逻辑推理能力雪崩,复杂代码任务失败率飙升。目前官方已紧急回滚,并在 v2.1.116 中修复。 「这是一次错误的性能权衡」。开发者们可以放心更新,那个聪明的 Claude 已经回来了。 原文链接: https://www.anthropic.com/engineering/april-23-postmortem

1 分钟

🧠📊「拒绝刷榜!HuggingFace发布Agent评测」

NEWS #NEWS / HuggingFace / Agent评测

告别跑分刷榜!Hugging Face 今日发布全新的 AI 智能体开源基准评测,直击大模型“高跑分、低实操”的硬伤。 传统的 MMLU 等静态跑分早已被大厂污染,而新基准专注于评估模型在具体工具调用、多步工作流执行及动态错误纠正等真实智能体(Agent)场景下的行动能力。评测结果极其残酷:在普通跑分上能打成平手的模型,在面临实际工具交互时表现天差地别。 这标志着大模型评测正从“理论考试”迈向“生存实战”。对于应用层开发者而言,它是极具实战参考价值的模型选型指南,可以直接在 Hugging Face 平台一键拉起在自建工具上运行。 原文链接: https://huggingface.co/blog/is-it-agentic-enough

1 分钟