首页
要闻详情
图标图标

参数量 42 亿,微软公布 SLM 小语言 AI 模型最新成员 Phi-3-vision

亚汇网亚汇网
关注
2024-05-26 09:02:28
302
据介绍,hi-3-viio是微软hi-3家族首款多模态模型,该模型的文字理解能力基于hi-3-ii,同时也具备hi-3-ii的轻量特点,能够在移动平台/嵌入终端中运行;该模型参数量为42亿,大于hi-3-ii(3.8),但小于hi-3-all(7),上下文长度为128ktok,训练期间为2024年2月至4月。指股网注
据介绍,Phi-3-vision是微软Phi-3家族首款多模态模型,该模型的文字理解能力基于Phi-3-mini,同时也具备Phi-3-mini的轻量特点,能够在移动平台/嵌入终端中运行;该模型参数量为42亿,大于Phi-3-mini(3.8B),但小于Phi-3-small(7B),上下文长度为128ktoken,训练期间为2024年2月至4月。指股网注意到,Phi-3-vision模型的最大特色正如其名,主要支持“图文识别能力”,号称能够理解现实世界的图片含义,还能快速识别提取图片中的文字。微软表示,Phi-3-vision特别适合办公场合,开发人员特别优化了该模型在识别图表和方块图(Blockdiagram)方面的理解能力,据称可以利用用户输入的信息进行推论,同时还能做出一系列结论,为企业提供战略建议,号称“效果比肩大模型”。在模型训练方面,微软声称Phi-3-vision是由“多种类型图片及文字数据训练而成”,包括一系列“经过严选的公开内容”,例如“教科书等级”教育材料、代码、图文标注数据、现实世界知识、图表图片、聊天格式等内容,从而确保模型输入内容的多样性。为了确保隐私,微软声称他们所使用的训练数据“可追溯”不包含任何个人信息。性能方面,微软提供了Phi-3-vision相较于字节跳动Llama3-Llava-Next(8B)、微软研究院和威斯康星大学、哥伦比亚大学合作的LlaVA-1.6(7B)、阿里巴巴通义千问QWEN-VL-Chat模型等竞品模型的比较图表,其中显示Phi-3-vision模型在多个项目上表现优异。目前微软已经将该模型上传至HuggingFace,感兴趣的小伙伴们可以访问项目地址:相关阅读:《广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,指股网所有文章均包含本声明。

风险提示及免责声明

文章来源于亚汇网,转载注明原文出处,此文观点与指股网无关,理性阅读,版权属于原作者若无意侵犯媒体或个人知识产权,请联系我们,本站将在第一时间删掉 ,指股网仅提供信息存储空间服务。