IDC、智源最新一期大模型评测结果出炉
6月17日记者获悉,由北京智源研究院(以下简称智源)打造的FlagEval天秤大模型评测平台实现了全面升级,并公布202406期FlagEval模型评测排行榜单。最新一期榜单显示,百度文心大模型、字节跳动“云雀”和“豆包”大模型的综合评分在闭源对话模型中位列前三,GPT-4o、百川、零一万物、kimi等紧随其后。智源FlagEval榜单截图。 来源:智源 据了解,FlagEval天秤大模型评测平台是北京智源研究院推出的开放的大模型评测体系,自2023年发布以来,该评测平台已从主要面向语言模型扩展到视频、语音、多模态模型,实现多领域全覆盖,目前已评测国内外 300 余个开源和商业闭源的语言及多模态大模型。资料显示,FlagEval大语言模型评测体系当前包含6大评测任务,近30个评测数据集,超10万道评测题目。6月的评测结果显示,在中文语境下,文心大模型等国内头部语言模型的综合表现出色。 就在上周,国际数据公司(IDC)发布......阅读全文
《中医药大模型评测标准》发布
近日,中医药交叉学科和智能科学大会在中国中医科学院举办,大会主题为“AI创新中医发展、数智均衡医疗资源”。国家中医药管理局副局长、中国中医科学院院长、中国工程院院士黄璐琦表示,中医药传承数千年,积累了海量的中医诊疗医案、处方等数据,但由于中医药名词术语与一般文本差别较大,挖掘其隐藏的知识、规律和经验
商汤大模型多个评测表现超ChatGPT
本报讯 (记者沈湫莎)商汤科技近日公布了自研中文语言大模型“商量SenseChat 2.0”在MMLU、AGIEval、C-Eval三个权威大语言模型评测基准的成绩。评测显示,“商量”在这三个测试集中的表现均领先ChatGPT,实现了我国语言大模型研究的突破。 全球三大权威语言模型测评基准
商汤大模型“商量”多个评测表现超ChatGPT
原文地址:http://news.sciencenet.cn/htmlnews/2023/6/503362.shtm
上海发布“书生·浦语”大模型:评测表现优秀
“书生·浦语”联合团队选取了20余项评测对其进行检验,其中包含全球最具影响力的四个综合性考试评测集,对“书生·浦语”、清华大学的GLM-130B、Meta的LLaMA-65B、OpenAI的ChatGPT和GPT-4进行了全面测试。6月7日,上海人工智能实验室(上海AI实验室)、商汤科技联合香港中文
谁是最会做题大模型?“高考评测”来了
2024年全国高考的“硝烟”刚刚散去不久,“大模型考生”就被抓回来重新“做题”了。市面上涌现出的大模型产品让人眼花缭乱,围绕“大模型技术哪家强”的讨论不绝于耳,各色名目的大模型评测应运而生。作为国内最权威的考试之一,高考覆盖各类学科及题型,同时在开考前属于“绝密”,非常适合用来作为考查大模型智能水平
国内首批大模型标准评测结果公布,4家通过
原文地址:http://news.sciencenet.cn/htmlnews/2023/12/514789.shtm12月22日,在全国信息技术标准化技术委员会人工智能分委会全体会议上,国内首个官方“大模型标准符合性评测”结果公布。结果显示,首批有四家公司的大模型产品通过该评测,分别为百度文心一言
IDC、智源最新一期大模型评测结果出炉
6月17日记者获悉,由北京智源研究院(以下简称智源)打造的FlagEval天秤大模型评测平台实现了全面升级,并公布202406期FlagEval模型评测排行榜单。最新一期榜单显示,百度文心大模型、字节跳动“云雀”和“豆包”大模型的综合评分在闭源对话模型中位列前三,GPT-4o、百川、零一万物、kim
评测成绩比肩GPT4,商汤日日新大模型再升级
原文地址:http://news.sciencenet.cn/htmlnews/2024/2/517164.shtm近日,商汤科技发布“日日新SenseNova 4.0”,多维度升级了大模型体系。据介绍,日日新SenseNova 4.0 具备更广泛的知识覆盖、更稳定的推理能力、更优秀的长文本理解力、
IDC、智源最新一期大模型评测结果出炉
6月17日记者获悉,由北京智源研究院(以下简称智源)打造的FlagEval天秤大模型评测平台实现了全面升级,并公布202406期FlagEval模型评测排行榜单。最新一期榜单显示,百度文心大模型、字节跳动“云雀”和“豆包”大模型的综合评分在闭源对话模型中位列前三,GPT-4o、百川、零一万物、k
讯飞星火在一项评测中获评“最聪明”国产大模型
原文地址:http://news.sciencenet.cn/htmlnews/2023/8/506755.shtm
第一!医渡科技大模型登顶上海AI实验室权威评测榜
5月9日,面向中文医疗大语言模型的开放评测平台MedBench更新评测榜单,医渡科技大模型(评测名:HH-YIDU-Med)以综合得分61.3分的出色成绩登顶榜首,成为榜单中首个综合评分超过60的医疗大模型。MedBench评测榜单节选 MedBench是由上海AI实验室和上海市数字医学创新中
构建生长育肥猪常用能量饲料营养价值评测模型
原文地址:http://news.sciencenet.cn/htmlnews/2023/2/494455.shtm记者2月23日从中国科学院亚热带农业生态研究所获悉,由中国工程院院士、该所首席研究员印遇龙科研团队黄瑞林研究员主持的“生长育肥猪常用能量饲料原料营养价值评定与预测方程建立”项目,已先后
面对大模型应用门槛高-如何大模型发挥更大价值?
原文地址:http://news.sciencenet.cn/htmlnews/2022/9/485510.shtm 人工智能预训练大模型的研发,面临着数据规模大、数据质量参差不齐、模型体积大、训练难度高、算力需求大等一系列挑战。在这样的背景下,如何加速大模型的产业落地,让大模型发挥更大价值?
权威AI基准评测发榜
6月30日,全球权威AI基准评测MLPerf最新V2.0训练评测成绩榜单公布。浪潮AI服务器表现优异,继两月前在MLPerf V2.0数据中心推理评测中斩获全部冠军后,本次又在MLPerf V2.0单机训练性能继续保持领先。 据了解,本次MLPerf 评测吸引了包括谷歌、NVIDIA、浪潮信息
AI大模型“拿捏”电池寿命
作为现代生活中不可或缺的能源载体,电池的重要性不言而喻。从清晨唤醒我们的闹钟,到随身携带的手机、平板电脑等智能设备,无一不依赖于电池提供的稳定电力。此外,随着科技的发展,电动汽车、无人机等新兴领域也广泛应用了各类高性能电池,推动了绿色出行和智能科技的进步。因此,电池不仅极大地便利了我们的日常生活,还
抢抓大模型行业机会
机器人在7月6日举行的2023世界人工智能大会展会现场进行投篮表演。大会展示包括大模型、芯片、机器人、智能驾驶等领域的科技成果。 新华社记者 方 喆摄 今年以来,自ChatGPT发布后,多家企业先后发布了自己的大模型产品,业内称之为“百模大战”。与此同时,产业界对大模型的关注点也在发生变化,从
GS-Junior、MiSeq和PGM-三大主流基因组测序仪对比评测
新一代基因组测序技术(Next-Generation Sequencing Technology)可谓掀开了生命科学新的篇章,不仅促进了许多研究方向的复苏或蓬勃发展,也为大众化基因组测序带来了希望,但是对于不熟悉测序技术的科研人员来说,要从这个竞争激烈的行业过热宣传中找到自己想要的测序仪,并
厦大尝试AI大模型破译甲骨文
近日,厦门大学信息学院自然语言处理实验室教授史晓东团队申报的“基于甲骨文多模态大模型的多元信息甲骨文辅助考释模型”入选“探元计划2024”“创新探索型项目”TOP10榜单。基于甲骨文多模态大模型的多元信息甲骨文辅助考释模型。厦门大学供图甲骨文也被称作“殷墟文字”,距今已有三千多年历史,是世界四大古文
辛烷值的评测标准
不同化学结构的烃类,具有不同的抗爆震能力。异辛烷(2,2,4-三甲基戊烷)的抗爆性较好,辛烷值给定为100。正庚烷的抗爆性差,给定为0。汽油辛烷值的测定是以异辛烷和正庚烷为标准燃料,按标准条件,在实验室标准单缸汽油机上用对比法进行的。调节标准燃料组成的比例,使标准燃料产生的爆震强度与试样相同,此
伏羲系列气象大模型2.0面世
中新社上海6月3日电 (记者 陈静)3日,“走进智能气象”主题活动暨智能气象创新生态联盟成立仪式在上海举办。全新升级、面向产业应用的伏羲系列气象大模型2.0(下文简称:“伏羲”2.0)面世,以“伏羲”2.0为核心的智能气象创新生态联盟同期成立。“伏羲”是人工智能驱动的次季节尺度气象大模型,可提供42
中科闻歌发布雅意大模型
原文地址:http://news.sciencenet.cn/htmlnews/2023/6/502201.shtm
大模型热要多点冷思考
行业大模型聚焦特定领域、针对特定场景、解决特定问题,能结合企业自身独特优势去精耕细作并赋能行业,从而形成差异化优势。走向细分领域才有更多机会,综合考虑行业专业性、持续迭代和综合成本等因素,行业大模型更容易实现商业价值落地。 用“百模大战”来形容当下人工智能大模型的火热程度一点也不夸张。数据显示
压缩算法为大语言模型“瘦身”
据美国科学促进会旗下网站19日报道,美国普林斯顿大学和斯坦福大学团队开发出一种新压缩算法CALDERA,能精简大型语言模型(LLM)的海量数据,为LLM“瘦身”。这项算法不仅有助保护数据隐私、节约能源、降低成本,还能推动LLM在手机和笔记本电脑上高效使用。团队举例称,当人们使用ChatGPT时,请求
释放AI大模型促消费潜力
今年的《政府工作报告》提出持续推进“人工智能+”行动,旨在抓住人工智能技术突破机遇,使我国数字技术与制造优势、市场规模优势充分结合,推动人工智能大模型广泛应用,真正赋能千行百业、走进千家万户。在构建新发展格局战略背景下,AI大模型在激活内需市场、促进消费升级等方面充满“模”力。 随着人工智能技
北京加快大模型应用落地见效
7月1日,2024全球数字经济大会人工智能专题论坛在中关村国家自主创新示范区会议中心举办。记者从论坛获悉,北京已发布的大模型产品有71个,约占全国一半,人工智能产业高地建设成效显著。未来,北京将加快实现大模型应用落地见效。人工智能在数字经济产业发展中具有很强的“头雁”效应,以大模型为代表的生成式人工
“大模型不是万能的”
“大模型不是万能的,不能过度神话它。”这句话,《中国科学报》记者今年在不同场合听到多次。最近一次,是在“CCF太原大模型赋能文物古建保护与传承论坛”上。自2022年底OpenAI推出大语言模型产品ChatGPT以来,世界仿佛一下子“觉醒”到大模型时代——不仅各“大厂”都在奋力发展大模型,喊出了“所有
首个量子领域大模型上线了!
百度量子计算研究所所长段润尧介绍,该量子领域大模型是在百度文心一言的基础上,使用量子领域高质量数据进行更有针对性的训练和优化而成的。它能更好地理解量子知识,执行量子领域相关任务。 据介绍,百度量子领域大模型将充分发挥技术协同效应,并提升现有大模型在训练速度、模型性能、交互效率等各个方面的能力。
国内首个渔业大模型范蠡大模型1.0发布
6月15日,范蠡大模型1.0 发布暨新质生产力推动京津冀现代渔业发展研讨会在京举行。会上发布了国内首个渔业大模型范蠡大模型1.0。范蠡大模型1.0由国家数字渔业创新中心主任、中国农业大学信息与电气工程学院教授李道亮团队联合中国联通、中国电信、中国移动三家运营商,以及全国主要水产院校和科研机构共同研发
国内首个渔业大模型范蠡大模型1.0发布
6月15日,范蠡大模型1.0 发布暨新质生产力推动京津冀现代渔业发展研讨会在京举行。会上发布了国内首个渔业大模型范蠡大模型1.0。 范蠡大模型1.0由国家数字渔业创新中心主任、中国农业大学信息与电气工程学院教授李道亮团队联合中国联通、中国电信、中国移动三家运营商,以及全国主要水产院校和科研机构
小型细胞计数设备评测数据参考
由于传统的血球计数板已不能满足高速发展的细胞研究需要,市场上各种自动细胞计数的设备越来越多。常见的主要分为两 类:基于图像的细胞计数仪(Automated vision-based counter)和基于库尔特电阻抗原理的细胞计数仪。两者主要区别在于,前者扫描仪器视野内图像,依靠设定的上下限细胞大小