斯坦福大模型评测榜 Claude 3 排名第一，阿里 Qwen2、零一万物 Yi Large 国产模型进入前十

斯坦福大学基础模型研究中心（CRFM）6 月 11 日发布了大规模多任务语言理解能力评估（Massive Multitask Language Understanding on HELM）排行榜，其中综合排名前十的大语言模型中有两款来自中国厂商，分别是阿里巴巴的 Qwen2 Instruct（72B）和零一万物的 Yi Large（Preview）。

据悉大规模多任务语言理解能力评估（MMLU on HELM）采用了 Dan Hendrycks 等人提出的一种测试方法，用于衡量文本模型在多任务学习中的准确性。这个测试内容包括基础数学、美国历史、计算机科学、法律等领域的 57 个任务。要在这个测试中获得高分，模型必须具备广泛的世界知识和解决问题的能力。IT之家附排名如下：

斯坦福大模型评测榜 Claude 3 排名第一，阿里 Qwen2、零一万物 Yi Large 国产模型进入前十

▲ 图源斯坦福大学基础模型研究中心官网

1、Claude 3 Opus（20240229）： Anthropic（美国，亚马逊投资）
2、GPT-4o（2024-05-13）：OpenAI（美国）
3、Gemini 1.5 Pro：谷歌（美国）
4、GPT-4（0613）：OpenAI（美国）
5、Qwen2 Instruct（72B）：阿里巴巴（中国）
6、GPT-4 Turbo（2024-04-09）：OpenAI（美国）
7、Gemini 1.5 Pro（0409 preview）：谷歌（美国）
8、GPT-4 Turbo（1106 preview）：OpenAI（美国）
9、Llama 3（70B）：Meta（美国）
10、Yi Large（Preview）：零一万物（中国）

Qwen2 是由阿里巴巴开发的一款开源大语言模型，发布于今年 6 月 6 日。Qwen2 系列包括 Qwen2-0.5B、Qwen2-1.5B、Qwen2-7B、Qwen2-57B-A14B 和 Qwen2-72B 在内的五个不同规模的预训练及指令微调模型；支持除英语和中文外的额外 27 种语言的数据训练；Qwen2-7B-Instruct 和 Qwen2-72B-Instruct 支持长 128K 个 token 的上下文。

Yi Large 是由零一万物公司开发的一款闭源大模型，Yi 模型系列基于 6B 和 34B 预训练语言模型，然后扩展到聊天模型、200K 长上下文模型、深度升级模型和视觉语言模型。官方宣称“其在关键基准测试分数上优于 GPT-4 和 Claude 3 Opus 等领先模型”。

声明：内容来源公开的各类媒体平台，若收录的内容侵犯了您的权益，请联系邮箱，本站将第一时间处理。

斯坦福大模型评测榜 Claude 3 排名第一，阿里 Qwen2、零一万物 Yi Large 国产模型进入前十

高通开放 AI 模型，助力开发者打造骁龙 X Elite 平台智能应用

Hugging Face CEO：越来越多 AI 初创公司创始人希望出售自家公司

AI微博

AI应用

5000+AI应用！每日更新

1AICLUB

强烈推荐！官方品牌微博

AI教程

海量教程看不完

AI基础训练营

零基础入门，带你成为AI高手

1ai抖音

1ai大神

抖音号：1ai.net

1ai大神

抖音号：1ai.net

1ai微信

每天五分钟

一年变大神

扫码关注

相关内容：

高通开放 AI 模型，助力开发者打造骁龙 X Elite 平台智能应用

Hugging Face CEO：越来越多 AI 初创公司创始人希望出售自家公司

防止聊天机器人“造谣”，谷歌 Deepmind、斯坦福大学研究人员推出 AI 事实核查工具

斯坦福大学发布《2024 年人工智能指数报告》：中国 AI 专利数第一，顶级 AI 模型较少

斯坦福团队为抄袭清华系面壁智能 AI 模型道歉：Llama3-V 模型将悉数撤下

“HumanPlus”机器人问世：可模仿人类动作弹钢琴、叠衣服，基于中国公司平台

请输入验证码

....支付确认中....

AI应用

5000+AI应用！每日更新

1AICLUB

强烈推荐！官方品牌微博

AI教程

海量教程看不完

AI基础训练营

零基础入门，带你成为AI高手

1ai大神

抖音号：1ai.net

1ai大神

抖音号：1ai.net

每天五分钟

一年变大神

扫码关注