华中科技大学开源多模态大模型Monkey

Monkey 是华中科技大学与金山软件联合推出的一种高性能多模态大模型，通过提高输入分辨率和引入多级描述生成方法，解决了现有模型在复杂场景和视觉细节处理方面的挑战。Monkey 可以基于现有视觉编辑器进行构建，无需从0预训练，大大提高了研发效率。

Monkey 的多级描述生成方法可以为模型提供丰富的上下文信息，指导模型学习场景和对象之间的关联。通过在16个不同的数据集上进行测试，Monkey 在图像字幕、视觉问答、文档分类等多模态任务上取得了出色的成绩。Monkey 展现了超强的细微视觉信息感知和复杂场景理解能力，具有广泛的应用空间。

开源地址:https://github.com/Yuliang-Liu/Monkey

论文地址:https://arxiv.org/abs/2311.06607v1

Monkey 的训练数据集质量是其能力提升的关键，研究人员生成了数十万条高质量的图像描述数据，并利用多个模型自动生成文字描述，并将不同模型的输出融合起来，提升了大模型对图像细节的理解能力。

在模型选择方面，Monkey 采用了开源模型 Qwen-VL 作为语言解码器，以及20亿参数的 ViT-BigHuge 作为视觉编码器，避免了重复预训练的资源浪费。为了提升 Monkey 的识别能力和输入分辨率，以及生成更丰富的图像描述和对复杂场景的理解能力，采用了多级描述生成、高分辨率编码和多任务训练三个训练阶段。

Monkey 在16个不同的数据集上进行了全面验证，包括图像字幕、通用视觉问答和文档导向问答等任务。在通用视觉问答任务上，Monkey 在多个数据集上都显示出明显的优势。在图像字幕任务上，Monkey 在 TextCaps 数据集上也表现出色，证明了其对图片中文本元素的多模态理解能力。

在文档导向问答任务上，Monkey 在多个文档图像理解数据集上取得了不错的成绩。研究人员表示，Monkey 在医学影像、卫星图像等领域具有广泛的应用空间，并将继续优化 Monkey 模型的感知、联想、推理和泛化能力。

综上所述，Monkey 是一种高性能多模态大模型，通过提高输入分辨率和引入多级描述生成方法，解决了复杂场景和视觉细节处理的挑战。Monkey 无需从0预训练，可以基于现有视觉编辑器进行构建，具有高效率和广泛的应用空间。通过在多个数据集上进行测试，Monkey 在多模态任务上取得了出色的成绩，展现了超强的视觉信息感知和场景理解能力。未来，Monkey 将继续优化模型的感知、联想、推理和泛化能力，进一步提升其在各领域的应用价值。

声明：内容来源公开的各类媒体平台，若收录的内容侵犯了您的权益，请联系邮箱，本站将第一时间处理。

华中科技大学开源多模态大模型Monkey

三星设备端 AI 命名为 Galaxy AI，将于下月在 Galaxy S24 上首次亮相

“AI脱衣”应用横行访问量剧增达2400万人次

AI微博

AI应用

5000+AI应用！每日更新

1AICLUB

强烈推荐！官方品牌微博

AI教程

海量教程看不完

AI基础训练营

零基础入门，带你成为AI高手

1ai抖音

1ai大神

抖音号：1ai.net

1ai大神

抖音号：1ai.net

1ai微信

每天五分钟

一年变大神

扫码关注

相关内容：

三星设备端 AI 命名为 Galaxy AI，将于下月在 Galaxy S24 上首次亮相

​“AI脱衣”应用横行 访问量剧增达2400万人次

元象大模型开源30款量化版本 可更低成本部署

昆仑万维宣布 4 月 17 日发布并开源“天工大模型 3.0”：4000 亿参数，号称性能超 Grok 1.0

智谱开源新一代多模态大模型CogVLM2

“全球首创”单台 RTX 4090 服务器推理，昆仑万维开源 2 千亿稀疏大模型天工 MoE

请输入验证码

....支付确认中....

AI应用

5000+AI应用！每日更新

1AICLUB

强烈推荐！官方品牌微博

AI教程

海量教程看不完

AI基础训练营

零基础入门，带你成为AI高手

1ai大神

抖音号：1ai.net

1ai大神

抖音号：1ai.net

每天五分钟

一年变大神

扫码关注

“AI脱衣”应用横行访问量剧增达2400万人次

元象大模型开源30款量化版本可更低成本部署