史上最难AI测试:顶尖模型也仅答对一半
随着人工智能系统在长期沿用的学术基准上得分极高,研究者注意到一个日益严重的问题:曾经难住机器的测试,如今已经不够难了,分数虚高掩盖了真实能力的短板。 曾经被认为严苛的MMLU(大规模多任务语言理解)考试,已无法恰当衡量当今先进AI模型的能力。为此,一支近千名研究者(含得州农工大学一位教授)组成的全球团队,开发了新型测试。 成果是“人类最后考试”(Humanity's Last Exam,简称HLE)——一套2500题的评测,涵盖数学、人文学、自然科学、古代语言及众多高度专业的学术领域。项目细节发表于《自然》,更多信息见lastexam.ai。 得州农工大学计算机科学与工程系讲师通·阮(Tung Nguyen)博士是众多贡献者之一,参与编写并打磨了大量试题,是核心成员之一,对题库的数学与计算机科学部分贡献尤多。 阮说:“当AI在人类基准上表现极好,我们容易以为它们接近人类水平的理解。但HLE提醒我们,智能不止于模式识别——更关乎......阅读全文
大语言模型在线辩论说服力超人类
实验设计示意图。图片来源:英国《自然·人类行为》在线版《自然·人类行为》19日发表的一项人工智能(AI)研究发现,在线辩论中,GPT-4一类的大语言模型(LLM)如能根据对手的个性化信息调整它们的论据,其说服力比人类辩手高出64%。研究结果显示了GPT-4生成有针对性和说服力论据的能力,揭示出AI工
史上最难AI测试:顶尖模型也仅答对一半
随着人工智能系统在长期沿用的学术基准上得分极高,研究者注意到一个日益严重的问题:曾经难住机器的测试,如今已经不够难了,分数虚高掩盖了真实能力的短板。 曾经被认为严苛的MMLU(大规模多任务语言理解)考试,已无法恰当衡量当今先进AI模型的能力。为此,一支近千名研究者(含得州农工大学一位教授)组成的全
百度文心大模型3.5已内测应用,实测得分超ChatGPT
原文地址:http://news.sciencenet.cn/htmlnews/2023/6/503251.shtm 6月20日消息,据内部人士透露,百度文心大模型3.5版本已内测可用。早在5月末中关村论坛上,百度创始人、董事长兼CEO李彦宏透露,百度大模型产品“文心一言”的“母本”将迎来3.5
实测得分超ChatGPT!百度文心大模型3.5版内测应用
原文地址:http://news.sciencenet.cn/htmlnews/2023/6/503256.shtm 6月20日消息,据内部人士透露,百度文心大模型3.5版本已内测可用。早在5月末中关村论坛上,百度创始人、董事长兼CEO李彦宏透露,百度大模型产品“文心一言”的“母本”将迎来3.5
压缩算法为大语言模型“瘦身”
据美国科学促进会旗下网站19日报道,美国普林斯顿大学和斯坦福大学团队开发出一种新压缩算法CALDERA,能精简大型语言模型(LLM)的海量数据,为LLM“瘦身”。这项算法不仅有助保护数据隐私、节约能源、降低成本,还能推动LLM在手机和笔记本电脑上高效使用。团队举例称,当人们使用ChatGPT时,请求
日本将开发更强日语能力的“大语言模型”人工智能技术
据共同社消息,日本东北大学和日本东京工业大学等团队计划开发一种更强日语能力的“大语言模型”,作为生成式人工智能(AI)的基础技术。该团队将利用理化学研究所的超级计算机“富岳”学习大量数据,并将在本年度内逐步公开。这一技术的开发将使国内企业和研究人员能够为自己的公司的服务或研究而自行改良。生成式AI可
360智脑通过中国信通院可信AIGC大语言模型功能评估
原文地址:http://news.sciencenet.cn/htmlnews/2023/6/502739.shtm6月12日,360智脑的360GPT-S2-V8型号产品获得了中国信息通信研究院(以下简称“中国信通院”)“可信AIGC大语言模型基础能力”评估报告(以下简称“报告”),报告显示必选项
人工智能新模型可解码DNA隐藏“语言”
DNA包含了维持生命所需的基础信息。理解这些信息是如何存储和组织的,一直是20世纪最大的科学挑战之一。现在,借助GROVER这一基于人类DNA训练的新型大型语言模型,研究人员有望解码基因组中隐藏的复杂信息。GROVER由德国德累斯顿工业大学生物技术中心开发,它将人类DNA视为文本,通过学习其规则和上
人工智能新模型可解码DNA隐藏“语言”
DNA包含了维持生命所需的基础信息。理解这些信息是如何存储和组织的,一直是20世纪最大的科学挑战之一。现在,借助GROVER这一基于人类DNA训练的新型大型语言模型,研究人员有望解码基因组中隐藏的复杂信息。GROVER由德国德累斯顿工业大学生物技术中心开发,它将人类DNA视为文本,通过学习其规则
人工智能新模型可解码DNA隐藏“语言”
DNA包含了维持生命所需的基础信息。理解这些信息是如何存储和组织的,一直是20世纪最大的科学挑战之一。现在,借助GROVER这一基于人类DNA训练的新型大型语言模型,研究人员有望解码基因组中隐藏的复杂信息。GROVER由德国德累斯顿工业大学生物技术中心开发,它将人类DNA视为文本,通过学习其规则和上
人工智能新模型可解码DNA隐藏“语言”
DNA包含了维持生命所需的基础信息。理解这些信息是如何存储和组织的,一直是20世纪最大的科学挑战之一。现在,借助GROVER这一基于人类DNA训练的新型大型语言模型,研究人员有望解码基因组中隐藏的复杂信息。GROVER由德国德累斯顿工业大学生物技术中心开发,它将人类DNA视为文本,通过学习其规则和上
人工智能新模型可解码DNA隐藏“语言”
科技日报北京8月6日电 (记者张佳欣)DNA包含了维持生命所需的基础信息。理解这些信息是如何存储和组织的,一直是20世纪最大的科学挑战之一。现在,借助GROVER这一基于人类DNA训练的新型大型语言模型,研究人员有望解码基因组中隐藏的复杂信息。GROVER由德国德累斯顿工业大学生物技术中心开发,它将
8个小技巧“用好”大语言模型
用大语言模型,还需要技巧?在人们的印象中,这是个极其简单的操作:只需输入一个问题,立刻就能得到回答。但实际上,如何有效地与这些人工智能模型互动,发挥出它们的最大潜力,却是一个经常被忽视的话题。中国科学技术大学心理学系特任研究员林志成关注到这一话题,并在他最近的评论文章中提供了一系列的策略和指导,希望
先进的人工智能模型居然不会“问诊”
一项新研究发现,虽然先进的人工智能(AI)模型在专业医学考试中得分很高,但在医生最重要的任务之一 ——与患者交谈以收集相关医疗信息并提供准确诊断方面,仍然表现不佳。1月2日,相关研究成果发表于《自然-医学》。图片来源:Just_Super/Getty Images美国哈佛大学的Pranav Rajp
商汤大模型多个评测表现超ChatGPT
本报讯 (记者沈湫莎)商汤科技近日公布了自研中文语言大模型“商量SenseChat 2.0”在MMLU、AGIEval、C-Eval三个权威大语言模型评测基准的成绩。评测显示,“商量”在这三个测试集中的表现均领先ChatGPT,实现了我国语言大模型研究的突破。 全球三大权威语言模型测评基准
新型AI芯片将大语言模型能耗减半
美国俄勒冈州立大学科研团队研发出一种新型AI芯片,成功将大语言模型的能耗降低50%。这项成果于近期在波士顿举行的IEEE定制集成电路会议上发布,是半导体领域的重大突破,有望成为解决大语言模型高能耗问题的“绿色钥匙”。 当前,以谷歌“双子座”和OpenAI的GPT-4为代表的大语言模型,因海量参
新引擎实现大语言模型推理速度显著提升
原文地址:http://news.sciencenet.cn/htmlnews/2023/11/511841.shtm
AI发展考核机制如何完善?
目前部分人工智能沉迷刷榜,在基准测试时高分通过,表现优异,但实际应用中却还会犯一些非常基础的错误。 近日,有媒体报道,目前部分人工智能沉迷刷榜,在基准测试时高分通过,表现优异,但实际应用中却还会犯一些非常基础的错误。这种沉迷刷榜,忽略实用性质的行为造成了部分AI模型“高分低能”的现象。那么,对
一夜易主——全球最强大模型由GPT4进入Claude-3-时代
Anthropic公司发布了最新的Claude 3系列模型,一举击败了全球最强AI模型GPT-4。Claude 3在多模态和语言能力等指标上表现出色,树立了新的行业基准。Claude 3系列包括Claude 3 Haiku、Claude 3 Sonnet和Claude 3 Opus,能力逐级增强。O
科学家评估大型语言模型回答医学问题的能力
图为研究团队的方法和现有技术的比较。Flan-PaLM540B模型在MedQA,MedMCQA和PubMedQA数据集上均超过了以往最先进的SOTA,每列上方显示的是准确率百分比。 你在网上搜过“我哪哪疼是不是得了啥啥病”吗?答案可能不尽如人意。但随着ChatGPT等大型自然语言模型(LLM)
网上断病,这轮AI行不行?专家:模型尚不完善
原文地址:http://news.sciencenet.cn/htmlnews/2023/7/504964.shtm ?图为研究团队的方法和现有技术的比较。Flan-PaLM 540B模型在MedQA,MedMCQA和PubMedQA数据集上均超过了以往最先进的SOTA,每列上方显示的是
硬刚“GPT4”,谷歌重磅推出最强杀手锏“Gemini”
12月6日,谷歌宣布推出其认为规模最大、功能最强大的人工智能模型Gemini。Gemini将包括三种不同的套件:Gemini Ultra,Gemini Pro和Gemini Nano。官方宣文中,概括出这三种套件的突出特性: Gemini Ultra——参数量最大,能力最强,适用于高度复杂的任
谁是最会做题大模型?“高考评测”来了
2024年全国高考的“硝烟”刚刚散去不久,“大模型考生”就被抓回来重新“做题”了。市面上涌现出的大模型产品让人眼花缭乱,围绕“大模型技术哪家强”的讨论不绝于耳,各色名目的大模型评测应运而生。作为国内最权威的考试之一,高考覆盖各类学科及题型,同时在开考前属于“绝密”,非常适合用来作为考查大模型智能水平
ChatGPT或将上岗医疗!哈佛医学教授亲测其表现接近医生
近期,ChatGPT因其高超的自然语言任务处理能力在各行各业爆火出圈。在编程、翻译、写论文等领域的应用,ChatGPT已经算是游刃有余。然而,在高壁垒的行业如医学领域中,ChatGPT却显得不够活跃。过去十年,神经网络、深度学习和人工智能 (AI) 等技术的进步已经对制造业、服务业和金融业等诸多行业
AI打败人类?人类完了
30日刊载美国科研成果网报道的《你比人工智能聪明吗?计算机语言模型在智商测试中胜过人类》。文章摘要如下: 美国加利福尼亚大学洛杉矶分校的研究人员发现,在衡量智力的一系列推理测试中,自回归语言模型“生成型已训练变换模型3”(GPT-3)的成绩明显优于普通大学生。该程序利用深度学习生成类似人类语言
上海发布“书生·浦语”大模型:评测表现优秀
“书生·浦语”联合团队选取了20余项评测对其进行检验,其中包含全球最具影响力的四个综合性考试评测集,对“书生·浦语”、清华大学的GLM-130B、Meta的LLaMA-65B、OpenAI的ChatGPT和GPT-4进行了全面测试。6月7日,上海人工智能实验室(上海AI实验室)、商汤科技联合香港中文
“顶流”之下,看人工智能喜与忧
目前,ChatGPT还没有通过图灵测试的评估。其实,迄今为止,还没有人工智能模型能真正通过图灵测试。 去年11月,美国人工智能研究公司OpenAI发布了一款名为ChatGPT的聊天机器人,其在推出后的几周内就风靡全球,甚至引发了一场新的全球人工智能竞赛。 社交媒体推特首席执行官埃隆·马斯克在
“AI+教育”,复旦推出大语言模型助力新生报到
8月25日,是复旦大学本科生新生报到的日子。来自全国各地和全球40多个国家的4300余名2024级本科新生,开启了在复旦的求学生涯。新生报道现场。为帮助来自世界各地的新同学尽快融入复旦大学,学校基于大语言模型,推出“复旦迎新助手”智能Agent。作为新生的贴心小帮手,大语言模型为新同学在迎新阶段提供
日本发布大规模语言模型
科技日报讯 (记者李杨)东京工业大学、日本理化学研究所及富士通公司等近日宣布,利用超级计算机“富岳”,他们开发的大规模语言模型“Fugaku-LLM”正式发布。“Fugaku-LLM”是首个完全由日本国产技术构建的AI语言模型,其在处理日语及相关文化内容上表现卓越。模型特别擅长基于日语敬语进行自然对
AI语言模型“提速”药物发现
原文地址:http://news.sciencenet.cn/htmlnews/2023/6/502762.shtm美国麻省理工学院和塔夫茨大学研究人员设计出一种基于大型语言模型(如ChatGPT)的人工智能算法,这种称为ConPLex的新模型可将目标蛋白与潜在的药物分子相匹配,而无需执行计算分子结