科研人员提出大语言模型复杂执行路径推理能力分析框架

近日,中国科学院软件研究所等围绕动态类型程序语言中复杂执行路径难以有效分析的问题,分析大语言模型的路径约束推理能力,并构建覆盖测试生成、路径可行性判定和缺陷检测的评测基准。 执行路径由程序从入口到出口依次经过的语句和分支构成,是理解程序语义、生成高覆盖测试和发现特定路径缺陷的基础。传统符号执行通过收集路径约束,并借助SMT求解器求解。但面对Python等语言的动态类型、复杂数据结构、对象行为及大量外部接口调用时,传统符号往往难以建立准确的约束模型。大语言模型在代码生成和理解方面的进展,为不依赖SMT约束求解的路径推理提供了可能,但能否沿复杂控制流准确推理且转化为真实软件测试收益,仍缺少研究。 为评估大语言模型能否进行正确的执行路径推理,研究团队围绕三个问题展开。一是给定目标执行路径,模型能否生成输入并准确复现该路径;二是给出路径和分支条件,模型能否判断路径可达、不可达或会触发特定类型缺陷;三是在包含第三方库和复杂依赖的真......阅读全文

科研人员提出大语言模型复杂执行路径推理能力分析框架

  近日,中国科学院软件研究所等围绕动态类型程序语言中复杂执行路径难以有效分析的问题,分析大语言模型的路径约束推理能力,并构建覆盖测试生成、路径可行性判定和缺陷检测的评测基准。  执行路径由程序从入口到出口依次经过的语句和分支构成,是理解程序语义、生成高覆盖测试和发现特定路径缺陷的基础。传统符号执行

新引擎实现大语言模型推理速度显著提升

原文地址:http://news.sciencenet.cn/htmlnews/2023/11/511841.shtm

OpenAI推出具备推理能力新AI模型

据ChatGPT制造者美国开放人工智能公司(OpenAI)官网12日报道,该公司已经成功研发出一系列具备推理能力的人工智能(AI)模型,并命名为“OpenAI o1”。这些模型的独特之处在于,其会花更长时间思考问题,再做出响应,就像人类一样。因此,这些模型能对复杂任务进行推理,解决以前模型很难解决的

OpenAI推出具备推理能力新AI模型

据ChatGPT制造者美国开放人工智能公司(OpenAI)官网12日报道,该公司已经成功研发出一系列具备推理能力的人工智能(AI)模型,并命名为“OpenAI o1”。这些模型的独特之处在于,其会花更长时间思考问题,再做出响应,就像人类一样。因此,这些模型能对复杂任务进行推理,解决以前模型很难解决的

OpenAI最新模型o3展现强大推理能力

  12月20日,美国开放人工智能研究中心(OpenAI)介绍了其最新的人工智能(AI)推理模型——o3及其轻量版o3-mini。该公司宣称,o3具备更先进、近似人类的推理能力,在代码编写、数学竞赛和掌握人类博士级别的科学知识等方面,均超越了其“前辈”o1。  不过,英国《新科学家》网站在12月22

压缩算法为大语言模型“瘦身”

据美国科学促进会旗下网站19日报道,美国普林斯顿大学和斯坦福大学团队开发出一种新压缩算法CALDERA,能精简大型语言模型(LLM)的海量数据,为LLM“瘦身”。这项算法不仅有助保护数据隐私、节约能源、降低成本,还能推动LLM在手机和笔记本电脑上高效使用。团队举例称,当人们使用ChatGPT时,请求

日本将开发更强日语能力的“大语言模型”人工智能技术

据共同社消息,日本东北大学和日本东京工业大学等团队计划开发一种更强日语能力的“大语言模型”,作为生成式人工智能(AI)的基础技术。该团队将利用理化学研究所的超级计算机“富岳”学习大量数据,并将在本年度内逐步公开。这一技术的开发将使国内企业和研究人员能够为自己的公司的服务或研究而自行改良。生成式AI可

学者发布无机材料AI模型,推理能力到达新高度

松山湖材料实验室研究员孟胜/刘淼团队在国家自然科学基金等项目的支持下,研发了一种基于深度学习图结构的通用预训练力场(graph-based pre-trained transformer force field,简称GPTFF)。相关成果近日发表于《科学通报(英文版)》(Science Bullet

8个小技巧“用好”大语言模型

用大语言模型,还需要技巧?在人们的印象中,这是个极其简单的操作:只需输入一个问题,立刻就能得到回答。但实际上,如何有效地与这些人工智能模型互动,发挥出它们的最大潜力,却是一个经常被忽视的话题。中国科学技术大学心理学系特任研究员林志成关注到这一话题,并在他最近的评论文章中提供了一系列的策略和指导,希望

青年科学家:尺度定律不能显著提高模型因果推理能力

幻觉和泛化是模型落地绕不开的话题。模型的幻觉带来错误回答,使得人们在一些关键的认知上产生疑虑,一定程度上会阻碍大模型落地。由于过分注重尺度定律,人力、算力等大量资源资源投入到尺度定律,导致基层研究人员没有足够多的计算资源研究新的模型路线,挤压创新空间。青年科学家共同探讨大模型技术架构的未来可能性人工

研究显示:大推理模型的“思维链”效果存疑

大型推理模型(LRM)到底是在“推理”,还是仅仅给出了正确答案却说错了理由?2025年,东北大学和加州大学伯克利分校的团队对前沿开源LRM的研究显示,模型在基准数学题上产生的“思考步骤”中,有 30%到60% 对最终答案“几乎无因果影响”——砍掉一半,性能几乎不掉。作者魏彦诗(Weiyan Shi

通用大模型的发展路径与挑战

  当今世界,以大模型为代表的通用人工智能技术在全球范围内扮演着日益重要的角色,对推动全球科技进步和经济发展起到重要的作用。  时代的拷问也随之而至:未来通用大模型的发展路径是什么?如何构建高效、自主的算法算力?如何利用大模型等先进人工智能技术来构建新一代科学研究的新范式?  日前,第二十六届中国科

通用大模型的发展路径与挑战

当今世界,以大模型为代表的通用人工智能技术在全球范围内扮演着日益重要的角色,对推动全球科技进步和经济发展起到重要的作用。时代的拷问也随之而至:未来通用大模型的发展路径是什么?如何构建高效、自主的算法算力?如何利用大模型等先进人工智能技术来构建新一代科学研究的新范式?日前,第二十六届中国科协年会“通用

新型AI芯片将大语言模型能耗减半

  美国俄勒冈州立大学科研团队研发出一种新型AI芯片,成功将大语言模型的能耗降低50%。这项成果于近期在波士顿举行的IEEE定制集成电路会议上发布,是半导体领域的重大突破,有望成为解决大语言模型高能耗问题的“绿色钥匙”。  当前,以谷歌“双子座”和OpenAI的GPT-4为代表的大语言模型,因海量参

OpenAI-发布新一代大模型,更擅长推理也更贵

传说中的“草莓”现身,9月12日晚间,OpenAI正式对外发布一款名为o1的新模型,这款模型为该公司下一代 “推理” 模型中的第一个,o为“Orion(猎户座)”,这款模型可以比人类更快地回答更复杂的问题。与以前的模型相比,在编写代码和解决多步骤问题方面做得更好。但它也比此前发布的GPT-4o更贵,

科学家评估大型语言模型回答医学问题的能力

  图为研究团队的方法和现有技术的比较。Flan-PaLM540B模型在MedQA,MedMCQA和PubMedQA数据集上均超过了以往最先进的SOTA,每列上方显示的是准确率百分比。  你在网上搜过“我哪哪疼是不是得了啥啥病”吗?答案可能不尽如人意。但随着ChatGPT等大型自然语言模型(LLM)

中国农业大学发布“工耕”农业机器人大模型

  7月3日,在2026全球数字经济大会物联网与智慧城市专题论坛上,中国农业大学农业具身智能机器人团队正式发布“工耕”农业机器人大模型。  发布现场,团队负责人、中国农业大学教授陈建介绍了“工耕”农业机器人大模型。该模型面向作物生产场景,针对教学科研和农业生产中的实际需求,聚焦农业具身智能机器人核心

大语言模型在线辩论说服力超人类

实验设计示意图。图片来源:英国《自然·人类行为》在线版《自然·人类行为》19日发表的一项人工智能(AI)研究发现,在线辩论中,GPT-4一类的大语言模型(LLM)如能根据对手的个性化信息调整它们的论据,其说服力比人类辩手高出64%。研究结果显示了GPT-4生成有针对性和说服力论据的能力,揭示出AI工

我国科学家提出高效推理策略-可避免大模型“过度思考”

  随着人工智能大模型的不断发展,如何让其在“难”的问题上深入思考,而不是对所有问题“想个不停”?记者5月29日从中国科学院自动化研究所获悉,该所联合鹏城实验室提出了一种高效推理策略AutoThink,可让大模型实现自主切换思考模式,避免“过度思考”。  “当前,越来越多的大模型开始具备‘深度思考能

“AI+教育”,复旦推出大语言模型助力新生报到

8月25日,是复旦大学本科生新生报到的日子。来自全国各地和全球40多个国家的4300余名2024级本科新生,开启了在复旦的求学生涯。新生报道现场。为帮助来自世界各地的新同学尽快融入复旦大学,学校基于大语言模型,推出“复旦迎新助手”智能Agent。作为新生的贴心小帮手,大语言模型为新同学在迎新阶段提供

为何大语言模型越狱漏洞引发整个业界的安全关注?

只需几句巧妙的提示,全球最先进的大语言模型就能被劫持,吐出制造燃烧弹、甲基苯丙胺乃至铀浓缩设施的详细步骤。独立网络安全研究员大卫·库兹玛在一年多时间里发现了七种越狱方法,而多数模型厂商对漏洞披露几乎置若罔闻——这正是整个行业必须正视的安全警钟。一、案例详情:从泰坦尼克到核材料2024 年 10 月,

“紫东太初”全模态大模型开启AGI新路径

原文地址:http://news.sciencenet.cn/htmlnews/2023/5/500126.shtm“‘紫东太初’2.0全模态大模型可融入3D、视频、传感信号等更多模态数据,并优化语音、视频和文本的融合认知及常识计算等功能,进一步突破感知、认知和决策的交互屏障。”5月6日,在华为昇腾

日本发布大规模语言模型

科技日报讯 (记者李杨)东京工业大学、日本理化学研究所及富士通公司等近日宣布,利用超级计算机“富岳”,他们开发的大规模语言模型“Fugaku-LLM”正式发布。“Fugaku-LLM”是首个完全由日本国产技术构建的AI语言模型,其在处理日语及相关文化内容上表现卓越。模型特别擅长基于日语敬语进行自然对

AI语言模型“提速”药物发现

原文地址:http://news.sciencenet.cn/htmlnews/2023/6/502762.shtm美国麻省理工学院和塔夫茨大学研究人员设计出一种基于大型语言模型(如ChatGPT)的人工智能算法,这种称为ConPLex的新模型可将目标蛋白与潜在的药物分子相匹配,而无需执行计算分子结

日本发布大规模语言模型

  东京工业大学、日本理化学研究所及富士通公司等近日宣布,利用超级计算机“富岳”,他们开发的大规模语言模型“Fugaku-LLM”正式发布。  “Fugaku-LLM”是首个完全由日本国产技术构建的AI语言模型,其在处理日语及相关文化内容上表现卓越。模型特别擅长基于日语敬语进行自然对话,并展现出在人

智谱发布推理模型初代版本

12月31日,国内明星大模型创业公司北京智谱华章科技有限公司推出基于扩展强化学习技术训练的推理模型GLM-Zero-Preview,擅长处理数理逻辑、代码和需要深度推理的复杂问题。GLM-Zero-Preview是GLM-Zero的初代版本。智谱表示,目前的GLM-Zero-Preview与Open

中国首个海洋领域开源大模型OceanGPT正式发布

近日,中国首个海洋领域开源大模型OceanGPT(沧渊)在杭州正式发布。该大模型由海洋精准感知技术全国重点实验室(浙江大学)牵头研发,具备基础的海洋专业知识问答,以及声呐图像、海洋观测图等海洋特色多模态数据的自然语言解读能力。其采用的领域知识增强“慢思考”推理机制,相较现有通用大模型能有效降低幻觉式

东北大学研究团队发布TechGPT2.0大语言模型

近日,计算机科学与工程学院任飞亮副教授主持的“东北大学知识图谱研究组”发布了大语言模型TechGPT2.0。TechGPT-2.0在继承了TechGPT-1.0全部特性的同时,通过增加多领域、多任务的数据,展现出了嵌套实体的抽取、幻觉回答、回答不可回答问题和回答长文本问题的能力。这些改进使得模型更适

东北大学研究团队发布TechGPT2.0大语言模型

  近日,计算机科学与工程学院任飞亮副教授主持的“东北大学知识图谱研究组”发布了大语言模型TechGPT2.0。  TechGPT-2.0在继承了TechGPT-1.0全部特性的同时,通过增加多领域、多任务的数据,展现出了嵌套实体的抽取、幻觉回答、回答不可回答问题和回答长文本问题的能力。这些改进使得

科研人员利用大语言模型解释调节睡眠的分子机制

华中科技大学生命学院张珞颖团队和薛宇团队在Nature Communications杂志上合作发表了题为“Large-language models facilitate discovery of the molecular signatures regulating sleep and activ