大模型权威报告：讯飞星火得分第一

返回首页　

设为首页　

加入收藏　

今天是:

网站首页美食历史游戏育儿数码时尚养生保健影视

大模型权威报告：讯飞星火得…
宪法知识问答和宪法的历史沿…
最多玩家用的csgo箱子开箱网…
假期孩子变成“手机控”怎样…
八大最多玩家用的csgo箱子开…
流言板]顺利晋级第二轮冰尘发…
多玩游戏关联公司再被市场监…
李玫瑾：养育男孩12岁前立威…
育儿专家诸富祥彦：如何突破…
终于不是丧偶式育儿了13岁男…
解决“男孩危机”靠父亲育儿
育儿小技巧：备好合适机能鞋…
王者荣耀可复制的特殊符号有…
远东股份：远东智慧能源股份…
教你在 Word 中录入 ①②③④…
中地数码：科研孤勇者“干成…
北京市人民政府办公厅关于印…
中国服装第一街又有新动作佳…
风华五年：大融汇蝶变、潮流…
北京当代商城有什么牌子
【POP服装趋势网】女装时尚食…
上海简诣女装：时尚魅影女性…
真情服务解民忧兰州社工在行…
持续提高全民健康水平中医特…
白露已至请查收这份初秋养生…
免费发放绿豆汤青岛温馨巴士…
文明新风｜融通地产河南公司…
巩固拓展主题教育成果推动委…
泰安市中医医院开展医疗服务…
弘扬国粹送健康真情服务暖人…
让文明实践在百姓心中“亮”…
医保报销有哪些注意事项？医…
农村题材影视创作展现乡村振…
农村电视剧排行榜-经典又好看
399元买会员看遍各大视频平台…
农民影视 - 一个免费观看VIP…
农民影视免费观看vip
想要痛风不发作5类食物最好别…
糖尿病食谱测评：5款健康佳肴…
鲁迅先生有多热爱美食？看了…
看完这 10 本「非主流」食谱…
全网首发！让你厨艺大涨的秘…
女子穿汉服拍照被认作日本服…
06年男子挖自家祖坟挖出大量…
不可不知的40个历史典故你知…
张予曦穿上“汉服”仿佛穿越…
共观博物中国《华山论剑大讲…
OPPO手机市场手机游戏中心寻…
提速！OPPO游戏中心大更新全…
游戏中心 coloros oppo

专题栏目

您现在的位置：生活资讯网 >> 历史 >> 正文

高级搜索

大模型权威报告：讯飞星火得分第一

作者：佚名文章来源：本站原创点击数：更新时间：2023/9/11 22:51:59 | 【字体：小大】

　　大清小富婆央广网合肥8月17日消息（记者徐鹏）《麻省理工科技评论》中国最新发布的大模型评测报告显示，在8个一级大类的600道题目的测试和盲评中，讯飞星火认知大模型V2.0在6个大类中得分率排名第一，在此次评测中表现突出，以81.5分（百分制计）的成绩在本次评测中登顶，荣获“最聪明”的国产大模型称号。

　　《麻省理工科技评论》中国从研发和商业化能力、外界态度以及发展趋势等维度全方位检测大模型的能力，力图评出“最聪明”的国产大模型。选取了“讯飞星火”等作为中文大模型平台的代表，展开系统、科学的评测。

　　本次评测使用的测试集包含600道题目，覆盖了语言专项、数学专项、理科综合、文科综合、逻辑思维、编程能力、综合知识、安全性共8个一级大类，126个二级分类，290个三级标签，并针对问题的丰富性和多样性做了优化。

　　在题目类型上，为了兼顾定量、定性的评价与测试，设置了“单选”、“多选”、“填空”、“简答”4个题型，分别有145道、138道、136道和181道。大模型评测体系使用盲评方式，客观评估国产大模型的聪明程度。

　　作为“最聪明”的大模型的基础能力，语言专项评测包含对话理解、多语种、讽刺、古诗词理解、文本生成、要点总结、情感分析、语义判断等61个二级分类，题型则以简答为主。结果显示，讯飞星火85.73%的得分率排名第一，明显高于平均值。

　　数学专项评测，是“最聪明”大模型必不可少的评测维度。本次评测包含代数、几何、解方程、复杂数学、统计学等9个二级分类，以选择题为主。

　　其中，讯飞星火以77.75%的得分率名列第一，远高于平均得分率56%，其他平台得分率基本相当。报告称，在大模型普遍“数学不好”的情况下，讯飞星火这一成绩颇为难得，其在数学专项上的领先同样体现在二级分类的评分结果上，在77.8%的二级分类中得分率第一，远超其他平台，初步判断其擅长几何与情景应用。

　　作为体现大模型“聪明程度”不可或缺的“硬核”部分，理科综合评测包含表格问答、化学、生物、物理、医学5个二级分类，题型上以单选和简答为主。

　　评测结果中，讯飞星火78.50%的得分率排名第一。另外，讯飞星火在理科综合大类下80%的二级分类评测中得分率为第一，化学与生物较为突出。

　　逻辑思维也是“最聪明”大模型的重要体现，本次逻辑思维评测在逻辑推理、思维链等方面设计了较多的题目，包含类比、常识推理、空间方位、演绎推理、逻辑谬误检测、因果推理等19个二级分类，题型上相对平均，其中填空题最多，多选题最少。

　　在逻辑思维题目中，讯飞星火81.25%的得分率名列第一，明显高于72.6%的平均值。此外，讯飞星火在逻辑思维63.2%的二级分类问题上得分率第一。逻辑思维对于大模型真正理解物理世界相当重要。

　　编程能力是大模型比较高阶的能力，本次的编程能力评测包含ASCII、ASCII码识别、Python、代码、代码修正、计算机6个二级分类，其中Python主要以简答形式评估大模型的代码生成能力和正确率，其他则以客观题的形式考察。

　　结果显示，讯飞星火80%的得分率明显高于71%的平均值，其他平台得分率基本相当。值得一提的是，在许多人关心的生成代码的简答题单项上，讯飞星火的得分率高达82%，远高于其他平台，表现颇为亮眼。

　　作为比较难的评测维度，综合知识对大模型的“聪明”程度要求也很高，涉及的题目较杂，包含百科问答、常识、科学知识、事实问答、工作技巧、谜语等13个二级分类，题型以多选为主。

　　在综合知识评测上，讯飞星火80.61%的得分率排名第一，在84.6%的二级分类上得分率第一，初步显示出在百科问答和历史人文上的“过人之处”。

　　报告指出，在本轮大模型评测中，讯飞星火以81.5分的成绩拔得头筹，成为国产大模型的第一名。

　　此外，就在8月12日，新华社研究院中国企业发展研究中心发布的《人工智能大模型体验报告2.0》中，讯飞星火V1.5以总分1013分位列本次国产主流大模型测评榜首位，在四大评测维度中的智商指数和工具提效指数两个维度获得第一，《报告》认为讯飞星火“在工作提效方面优势明显”。

　　在刚刚过去的8月15日，讯飞星火认知大模型V2.0如期发布，进一步突破代码能力和多模态能力。技术获得重大突破的同时，搭载讯飞星火V2.0核心能力的应用和产品也越来越丰富。

　　《麻省理工科技评论》中国最新发布的大模型评测报告显示，在8个一级大类的600道题目的测试和盲评中，讯飞星火认知大模型V2.0在6个大类中得分率排名第一，在此次评测中表现突出，以81.5分（百分制计）的成绩在本次评测中登顶，荣获“最聪明”的国产大模型称号。

历史录入：admin 责任编辑：admin
	上一个历史：宪法知识问答和宪法的历史沿革下一个历史：没有了

　栏目文章

大模型权威报告：讯飞星火得分第一 (09-11)	宪法知识问答和宪法的历史沿革 (09-11)
女子穿汉服拍照被认作日本服饰遭驱赶？园区回… (09-11)	06年男子挖自家祖坟挖出大量珍贵文物以为会轻… (09-11)
不可不知的40个历史典故你知道多少？值得收藏… (09-11)	张予曦穿上“汉服”仿佛穿越回了古代像是端庄… (09-11)
共观博物中国《华山论剑大讲堂》第一季收官！ (09-11)	影视作品背后的“文学之美”——由动画电影《… (09-10)
中国动画100岁了你最喜欢哪一部？ (09-10)	北京文化的辉煌旅程：宋歌为中国电影发展立下… (09-10)
二次元文化里的“中国红” (09-10)	功夫动漫三部动画荣获2023国家广电总局推荐国… (09-10)
明朝一位被黑成煤炭的人今天还原一下历史真相… (09-10)	续写经典《上下五千年》新时代版重磅发布 (09-10)
它究竟有什么魔力？能让中华上下五千年的人们… (09-10)	又现毒教材《世界上下五千年》不写中国是汉奸… (09-10)
中国历史上下5000年易中天凭啥说只有3700年？… (09-10)	颠覆黑格尔的观点：古代中国历史的进步与变迁 (09-09)
马上二模复习高三的你各科准备好了吗？ (09-09)	嘉兴市2023年小学科学课堂教学评比暨观摩活动… (09-09)

	设为首页加入收藏联系站长友情链接版权申明网站公告管理登录
	生活资讯网声明：登载内容出于传递信息之目的，绝不意味着赞同其观点或证实其描述，若侵权请来信告知，我们将及时处理！