导航菜单

约翰霍普金斯大学团队利用 LLM 开创一种创建神经网络

你有没有想过,一个大型语言模型在回答你的问题时,到底是在“思考”,还是在“回忆”?

约翰霍普金斯大学的研究团队最近做了一个有趣的实验,他们让GPT-NEO、BLOOM、StarCoder等模型执行机器翻译和代码生成任务,然后一层一层地“遮住”模型的注意力机制——结果发现,当模型处理到某个特定层后,即使移除后续的上下文信息,它依然能正确完成任务。

这个神奇的位置,被他们称为“任务识别点”。

模型如何“学会”任务?

想象一下你第一次学做一道菜。一开始你需要看着菜谱,每一步都要对照着来。但当你做过几次之后,可能只需要看一眼菜名,就能自然而然地把整道菜做出来,甚至不需要再看菜谱了。

大型语言模型的学习过程,和这个道理惊人地相似。

在最初的几层中,模型像一个认真的学生,仔细阅读你提供的每一个示例和指令。它需要理解你希望它做什么,比如“把这句话翻译成中文”或者“写一个计算斐波那契数列的函数”。但奇妙的是,到了某个临界点,模型突然“开窍”了——它不再需要依赖那些示例,因为它已经把这些知识内化到了自己的参数中。

为什么这很重要?

这个发现对我们理解AI有着深远的意义。

它解释了为什么大型语言模型能够“举一反三”。一旦模型理解了任务本质,它就能将这种能力泛化到从未见过的输入上。这就像是一个学会了烹饪的人,不仅能做学过的菜,还能根据同样的原理创造新的菜式。

这个发现为优化模型提供了新思路。既然后续的上下文信息是冗余的,我们就可以在模型推理时剪掉这些冗余计算,大幅提升效率。想象一下,如果每次用模型时只需要计算到“任务识别点”就够了,那该多省算力啊!

从模仿到创造

这项研究还揭示了一个更深层的道理:真正的智能不是机械地模仿,而是掌握规律后的创造。

模型在学习过程中,经历了从“看一个学一个”到“我懂了,我来做”的转变。这种转变,某种程度上类似于人类的学习方式——我们不是靠死记硬背来掌握一门语言或一项技能,而是理解其内在逻辑后,自然而然地应用。

这让AI看起来不再那么“黑盒”了。它让我们看到,大模型内部确实存在一个“顿悟”的时刻,一个从理解到执行的转折点。

我们该期待什么?

目前的研究还只是探索了翻译和代码生成这两个任务。未来,我们需要在更多任务上验证这个“任务识别点”是否普遍存在。

但无论如何,这项研究已经为我们打开了一扇窗:透过这扇窗,我们或许能更好地理解AI的“思维”过程,甚至找到让AI教AI更高效的方法。

毕竟,最宝贵的能力不是记住答案,而是知道该问什么问题,以及如何找到答案。而我们的模型,正在这条路上越走越远。

今日快讯:厦门8月6日电(记者林永传)第四届“山海杯”青少年足球赛正在福建厦门举行,32支球队的400余名足球少年,将在鹭岛绿茵场展开70场激烈角逐,以球会友、共同成长。本届赛事以“山海相连,同心两岸”为主题,参赛队员来自福建、北京、贵州、广西、青海、江苏、江西、新疆、宁夏、重庆、台湾、香港和澳门。比赛场地设在拥有百年足球底蕴的“全国青少年校园足球特色学校”厦门二中。(完)约翰霍普金斯大学团队利用 LLM 开创一种创建神经网络的相关文章

最新评论:

头像
匿名网友
文章段落之间需要自然承接,不能只是把独立句子简单排列。
4分钟前
头像
匿名网友
SEO数据出现变化后,需要结合修改记录判断可能原因。
16分钟前
头像
匿名网友
SEO不是一次性设置,网站变化后原有策略也需要重新核对。
1分钟前
头像
匿名网友
原创不只是换一种说法,更重要的是加入独立的信息角度。
56分钟前
头像
匿名网友
SEO文章也需要保持语言节奏,长短句适当变化更容易阅读。
48分钟前
二维码