- 上云资讯 -
2025-06-01 16:41:15 37人关注
云从科技的多模态大模型获全球认可,登顶 OpenCompass 榜单
近日,云从科技自主研发的多模态大模型 “从容 V2.0” 在全球知名的 OpenCompass 多模态榜单上以高达80.7分的优异成绩脱颖而出,荣登榜首。这一成就标志着中国在人工智能领域的进一步突破,尤其是在视觉感知、认知理解和跨领域应用等专业领域的表现令人瞩目。
2025-05-02 10:23:24 51人关注
AI基准测试平台LMArena陷争议:研究指责其偏袒OpenAI、谷歌和Meta
人工智能领域知名的公共基准测试平台LMArena近日遭遇信任危机。一项新的研究指出,该平台的排名系统存在偏袒OpenAI、谷歌和Meta等大型供应商的结构性问题,其不透明的流程和头部企业的固有优势可能导致排名失真。然而,LMArena运营团队已公开否认这些指控。
AI基准测试 LMarena争议 OpenAI基准测试 Google AI基准测试 Meta AI基准测试 AI大模型评测
2025-04-18 16:32:40 61人关注
AI 基准测试平台 Chatbot Arena 成立一家新公司
在 AI 行业快速发展的背景下,Chatbot Arena 这个众包 AI 基准测试项目正在扩展其影响力,正式成立了一家名为 Arena Intelligence Inc. 的新公司。根据彭博社的报道,Chatbot Arena 旨在通过这家新公司获取更多资源,从而显著改善其平台的功能和服务。
2025-01-23 17:31:10 138人关注
智源与腾讯推出长文本理解基准测试模型LongBench v2
在2024年12月19日的发布会上,智源研究院与腾讯宣布推出LongBench v2,这是一个专为评估大语言模型(LLMs)在真实世界长文本多任务中的深度理解与推理能力而设计的基准测试。该平台旨在推动长文本模型在理解和推理方面的进步,回应了当前长文本大语言模型在应用中的挑战。
2025-01-23 10:15:28 96人关注
大模型评测平台CompassArena升级 推出全新 Judge Copilot 功能
上海人工智能实验室司南OpenCompass团队与魔搭ModelScope联合推出的大模型评测平台CompassArena(大模型竞技场)近日迎来了新升级,旨在为用户提供更科学、全面的模型评估体验。自上线以来,该平台吸引了大量社区用户参与并贡献数据,基于这些数据,CompassArena不断优化,此次升级包括全新Judge Copilot功能和榜单算法的改进,以及新增20多个全新模型。
2025-01-22 16:26:13 376人关注
字节跳动发布豆包大模型1.5Pro,性能超越GPT-4o与Claude3.5Sonnet
字节跳动正式推出其最新的豆包大模型1.5Pro(Doubao-1.5-pro),这一新模型在多个领域的综合能力上表现出色,成功超越了行业内知名的 GPT-4o 和 Claude3.5Sonnet。该模型的发布标志着字节跳动在人工智能领域又向前迈出了重要一步。
字节跳动豆包大模型 Doubao Model 1.5 Pro GPT4o Claude3.5 Sonnet 大模型技术对比 AI大模型评测
2025-01-21 03:23:19 149人关注
通义千问联合魔搭社区开源测试集P-MMEval:可评测模型多语言能力
阿里巴巴达摩院联合魔搭社区ModelScope近期宣布开源一项新的多语言基准测试集P-MMEval,旨在全面评估大型语言模型(LLM)的多语言能力,并进行跨语言迁移能力的比较分析。这一测试集覆盖了基础和专项能力的高效数据集,确保了所有挑选的数据集中多语言覆盖的一致性,并提供了跨多种语言的并行样本,最高支持来自8个不同语族的10种语言,包括英语、中文、阿拉伯语、西班牙语、日语、韩语、泰语、法语、葡萄牙语和越南语。
2025-01-11 01:34:15 132人关注
大模型评测平台Compass Arena新增多模态大模型竞技版块
上海人工智能实验室司南 OpenCompass 团队与魔搭 ModelScope 最近宣布,他们的大模型评测平台 Compass Arena 进行了重要更新,推出了全新的多模态大模型竞技版块 Compass Multi-Modal Arena。这一新版块为用户提供了一个平台,可以体验和比较多款主流多模态大模型的效果,帮助用户找到最适合自己需求的模型。
2025-01-10 16:12:19 203人关注
智谱GLM-4-9B模型幻觉率仅1.3%,在全球大模型评测中夺魁
在人工智能领域,大语言模型的"幻觉问题"一直是困扰业界的关键挑战。近日,一项基于HHEM-2.1-Open评估体系的测试结果显示,智谱AI旗下的GLM-4-9B模型交出了一份令人瞩目的成绩单。