上云资讯 - 来上云吧，企业上云一站式服务

阿里云云原生阿里云开发者腾讯云开发者火山引擎开发者社区魔搭ModelScope社区微软科技 Azure云科技 Zilliz OpenAI Anthropic Gemini LangChain Hugging Face Mistral

2025-04-11 10:23:29 240人关注

推理AI模型基准测试成本激增:评估一个或需近3000美元

根据第三方AI测试机构Artificial Analysis的数据，评估OpenAI的o1推理模型在七种流行基准测试上需花费2，767.05美元，而其非推理模型GPT-4o仅需108.85美元。这一显著差异引发了关于AI评估可持续性和透明度的讨论。

AI模型基准测试 AI模型测试成本 AI测试成本激增大模型基准测试 AI模型性能评估

2025-01-16 21:35:44 317人关注

AI大模型数字比较出错引发讨论月之暗面回应9.11大于9.9:有助了解能力边界

近日，多家人工智能大模型在进行简单数字比较时出现错误引发广泛关注。包括字节豆包、GPT4o、月之暗面Kimi、阶跃星辰跃问、百川智能百小应等在内的多个知名AI模型，在回答"9.11和9.9哪个更大"这样的基础问题时均给出了错误答案。此外，此前有用户发现多个大模型在回答"strawberry"一词中有几个"r"时也出现了错误。

AI模型比较 AI错误响应 AI模型错误分析 AI模型性能评估 AI模型优化技巧

2025-01-10 06:43:37 1193人关注

OpenAI推出SWE-bench Verified:提升AI软件工程能力评估

OpenAI于8月13日宣布推出SWE-bench Verified代码生成评估基准，旨在更准确评估人工智能模型在软件工程任务中的表现。这一新基准解决了此前SWE-bench存在的多项局限性。

OpenAI SWE Bench 大模型技术验证 AI模型性能评估大模型基准测试 OpenAI技术验证流程

2024-12-26 20:11:20 204人关注

即使是顶尖AI模型也难以应对复杂旅行规划， OpenAI o1-preview也犯难

最近，一项新研究显示，即便是先进的 AI 语言模型，比如 OpenAI 最新的 o1-preview，在复杂的规划任务中也显得力不从心。

AI大模型复杂旅行规划 AI模型局限性 AI旅行规划挑战 AI模型性能评估

- 上云资讯 -

推理AI模型基准测试成本激增:评估一个或需近3000美元

AI大模型数字比较出错引发讨论月之暗面回应9.11大于9.9:有助了解能力边界

OpenAI推出SWE-bench Verified:提升AI软件工程能力评估

即使是顶尖AI模型也难以应对复杂旅行规划， OpenAI o1-preview也犯难

推荐阅读

上云服务

- 上云资讯 -

推理AI模型基准测试成本激增:评估一个或需近3000美元

AI大模型数字比较出错引发讨论 月之暗面回应9.11大于9.9:有助了解能力边界

OpenAI推出SWE-bench Verified:提升AI软件工程能力评估

​即使是顶尖AI模型也难以应对复杂旅行规划， OpenAI o1-preview也犯难

推荐阅读

上云服务

AI大模型数字比较出错引发讨论月之暗面回应9.11大于9.9:有助了解能力边界

即使是顶尖AI模型也难以应对复杂旅行规划， OpenAI o1-preview也犯难