突破叙事尺度 刻画极致人物 迷雾剧场《漂白》1月17日上线爱奇艺1月20日手机数码国补落地京东 超千万国补商品等你挑选超千万货品已备足 1月20日来京东购手机享国家补贴每件最高500元拥抱创新科技,探寻体育变革之路—— 第二届LALIGA EXTRATIME体育行业论坛在京成功举办斑马技术《2025全球消费者调查报告》:注重防损管理,增强顾客体验终端创企Nothing拟募资1亿美元 一加联合创始人创立恩智浦获欧洲投资银行 10 亿欧元贷款,用于在欧多国研发创新工作入手松下ZS99相机新品首选京东 售价2998元可先人一步入手1月20日打开京东搜索「1」 3C数码“疯狂星期一”爆款低至1元当代年轻人用上AI,从夸克开始消息称iPhone SE 4将有白色和黑色 预计3月份推出全球PC市场迎来温和复苏:2024年出货量增长1.3%,联想和苹果表现亮眼比亚迪已在韩国推出Atto 3 预计2月中旬开始交付发展新质生产力 赋能健康产品力 ——劲牌有限公司2024年度科技责任(成果)报告美光减产后 SK海力士也计划将上半年NAND闪存产量削减一成赵明离职信曝光:离开荣耀是人生中最艰难的决定消息称京东服饰换帅,阿里前高管担任负责人这年头,谁在互联网上学这么“硬核”的AI?开战2025,本地生活商家「另辟蹊径」年底Mini LED电视到底怎么选?认准这些新技术不踩雷!
  • 首页 > 云计算频道 > 大模型

    超GPT-4o,1240亿参数!最强开源多模态模型 Pixtral Large!

    2024年11月19日 09:39:34   来源:AIGC开放社区公众号

      今天凌晨,法国著名开源大模型平台Mistral.ai,开源了超大多模态模型——Pixtral Large。

      Pixtral Large有1240亿参数,支持128K上下文,能理解文本、图表、图像等,也是Mistral.ai自家聊天助手 le Chat目前正在使用的视觉模型。支持中文、法文、英文等十多种主流语言。

      根据测试数据显示,Pixtral Large在MMMU、MathVista、ChartQA、DocVQA、VQAv2等基准测试的数据,超过了GPT-4o、Gemini-1.5Pro、Claude-3.5Sonnet、Llama-3.290B,成为目前最强的开源多模态模型。

      同时,Mistral.ai还发布了一个免费的支持PDF理解、网络搜索、Canvas、AI Agent、图片生成的多模态AI助手——le Chat。

      Pixtral Large简单介绍

      Pixtral Large是基于Mistral Large2开发而成,有1230亿参数多模态解码器和10亿参数视觉编码器

      多模态解码器是Pixtral Large的核心,主要负责整合和处理来自视觉编码器的图像信息以及文本数据。这个庞大的参数量使得解码器能够捕捉到复杂的模式和关系,无论是在文本中的长距离依赖还是在图像中的细节,实现高质量的图像描述、视觉问答和文档理解等。

      而10亿参数的视觉编码器则是Pixtral Large处理图像数据的关键。这个编码器专门设计用于将图像转换为模型可以理解的高维特征表示。

      通过这种方式,Pixtral Large能够理解图像中的视觉元素,并将这些信息与文本数据结合起来,以产生更丰富的上下文理解和更准确的任务执行。

      在技术层面,Pixtral Large的视觉编码器采用了先进的变换器架构,能够有效地处理不同分辨率和宽高比的图像。这种灵活性对于处理现实世界中的图像至关重要,因为这些图像的尺寸和形状千差万别。此外,视觉编码器还采用了自注意力机制,模型能够在处理图像时考虑到全局上下文,而不仅仅是局部特征。

      Pixtral Large的多模态解码器则进一步将这些视觉特征与文本信息结合起来。通过这种方式,模型不仅能够理解图像中的内容,还能够理解这些内容如何与文本数据相互作用和关联,它允许模型在处理多模态输入时动态地调整其关注点。

      此外,Pixtral Large还采用了一种新颖的序列打包技术,这使得模型能够在单个批次中高效地处理多张图像。通过构建块对角掩码来确保不同图像之间的特征不会相互干扰,从而提高了模型处理多图像数据的效率和准确性。

      在长上下文窗口方面,Pixtral Large拥有128K的上下文窗口,这使得模型能够处理大量的文本和图像数据。这对于理解和总结长篇文档或处理包含多个图像的复杂场景至关重要。长上下文窗口确保了模型能够在处理这些复杂任务时保持信息的连贯性和完整性

      le Chat介绍

      今天凌晨,Mistral.ai还对他们的类ChatGPT助手le Chat进行了重磅更新。

      在这次更新中,Le Chat引入了网络搜索和引用功能,用户可以直接在聊天界面中搜索互联网上的最新信息,并获取带有引用链接的答案。对于学生和专业人士来说非常有帮助,可以在准备研究报告或学术论文时,快速准确地获取资料和数据。

      Le Chat还推出了一个全新的Canvas功能,支持想法的构思允许内联编辑和导出,极大地提高了创意工作的效率。用户可以在Canvas上进行头脑风暴、编辑内容,并将其导出为各种格式,方便进一步使用。

      现在Le Chat也能够处理大型、复杂的PDF文档和图像,得益于最新的多模态模型Pixtral Large,能够分析和总结文档中的图表、表格、图示、文本、公式和方程等内容。例如,它可以轻松解析著名的量子纠缠论文,展示出信息提取、总结和语义理解的强大能力。

      Le Chat还与Black Forest Labs合作,整合了领先的图像生成技术Flux Pro,使用户可以直接在Le Chat中生成高质量的图像。这一功能特别适用于创意设计和营销领域,用户可以快速生成符合需求的图像,提高工作效率。

      此外,Le Chat还提供了AI Agent功能。用户可以将特定类型的工作流程编码为 Agent,然后发布并与团队成员共享,实现更高效的工作流管理和自动化操作。常见的使用场景包括收据扫描、费用报告、会议纪要的总结和发票处理等。

      在性能提升方面,Le Chat通过投机性编辑技术,显著提高了响应速度,用户可以更快地获得高质量的回答和建议,提高了整体的工作效率。同时,Le Chat提供了一个从模型到输出的完全集成平台,用户可以在一个平台上完成所有的多模态任务,无需在多个工具之间切换,简化了工作流程。

      文章内容仅供阅读,不构成投资建议,请谨慎对待。投资者据此操作,风险自担。

    即时

    新闻

    明火炊具市场:三季度健康属性贯穿全类目

    奥维云网(AVC)推总数据显示,2024年1-9月明火炊具线上零售额94.2亿元,同比增加3.1%,其中抖音渠道表现优异,同比有14%的涨幅,传统电商略有下滑,同比降低2.3%。

    企业IT

    重庆创新公积金应用,“区块链+政务服务”显成效

    “以前都要去窗口办,一套流程下来都要半个月了,现在方便多了!”打开“重庆公积金”微信小程序,按照提示流程提交相关材料,仅几秒钟,重庆市民曾某的账户就打进了21600元。

    3C消费

    华硕ProArt创艺27 Pro PA279CRV显示器,高能实力,创

    华硕ProArt创艺27 Pro PA279CRV显示器,凭借其优秀的性能配置和精准的色彩呈现能力,为您的创作工作带来实质性的帮助,双十一期间低至2799元,性价比很高,简直是创作者们的首选。

    研究

    中国信通院罗松:深度解读《工业互联网标识解析体系

    9月14日,2024全球工业互联网大会——工业互联网标识解析专题论坛在沈阳成功举办。