咨询服务热线:021-26883548
电话:0755-86673560
邮箱:kaiyuncom@mjchuchen.com
总部:湖北省武汉市东湖新技术开发区高新大道637号
北京科技有限公司:北京市丰台区和义街道和义科创产业园内
上海科技有限公司:上海市静安区新闸路1403号2幢
官方网站-首页
你(nǐ)们(men)有(yǒu)没(méi)有(yǒu)想(xiǎng)过(guò),像(xiàng)那(nà)些(xiē)聊(liáo)天(tiān)机(jī)器(qì)人(rén)或(huò)者(zhě)无(wú)所(suǒ)不(bù)能(néng)的(de)AI大(dà)语(yǔ)言(yán)模(mó)型(xíng),它(tā)们(men)是(shì)怎(zěn)么(me)看(kàn)懂(dǒng)我(wǒ)们(men)写(xiě)的(de)字(zì),听(tīng)懂(dǒng)我(wǒ)们(men)说(shuō)的(de)话(huà)呢(ne)?它(tā)们(men)又(yòu)不(bù)认(rèn)识(shi)汉(hàn)字(zì),也(yě)不(bù)会(huì)说(shuō)中(zhōng)文,这(zhè)到(dào)底(dǐ)是(shì)怎(zěn)么(me)做(zuò)到(dào)的(de)呢(ne)?
给(gěi)每(měi)个(gè)词一(yī)个(gè)“秘(mì)密(mì)代(dài)号(hào)”
想(xiǎng)象(xiàng)一(yī)下(xià),我(wǒ)们(men)要(yào)教(jiào)电(diàn)脑(nǎo)认(rèn)识(shi)小(xiǎo)动(dòng)物(wù)。我(wǒ)们(men)不(bù)能(néng)直(zhí)接(jiē)给(gěi)它(tā)看(kàn)图(tú)片(piàn),得(de)用(yòng)一(yī)种(zhǒng)它(tā)能(néng)懂(dǒng)的(de)语(yǔ)言(yán)——数(shù)字(zì)!

我(wǒ)们(men)可(kě)以(yǐ)给(gěi)每(měi)个(gè)小(xiǎo)动(dòng)物打分,比如:
▷ 毛茸茸指数(1分代表不太毛茸茸(rōng),10分(fēn)代表超级毛茸茸)
▷ 汪汪叫指(zhǐ)数(shù)(1分(fēn)代(dài)表(biǎo)不(bù)叫(jiào),10分(fēn)代(dài)表(biǎo)很(hěn)会(huì)汪(wāng)汪(wāng)叫(jiào))
▷ 抓(zhuā)老(lǎo)鼠(shǔ)指(zhǐ)数(shù)(1分(fēn)代(dài)表(biǎo)不(bù)抓(zhuā),10分(fēn)代(dài)表(biǎo)抓(zhuā)老(lǎo)鼠(shǔ)高(gāo)手(shǒu))
那(nà)么(me),“小(xiǎo)狗(gǒu)”可(kě)能(néng)会(huì)得(de)到(dào)这(zhè)样(yàng)的(de)分(fēn)数(shù):毛(máo)茸(rōng)茸(rōng)指(zhǐ)数(shù) 7分(fēn),汪(wāng)汪(wāng)叫(jiào)指(zhǐ)数(shù) 9分(fēn),抓(zhuā)老(lǎo)鼠(shǔ)指(zhǐ)数(shù) 2分(fēn)。我(wǒ)们(men)可(kě)以(yǐ)把(bǎ)这(zhè)叫(jiào)做(zuò)小(xiǎo)狗(gǒu)的(de)“秘(mì)密(mì)代(dài)号(hào)”:(7, 9, 2)。
“小(xiǎo)猫(māo)”呢(ne)?可(kě)能(néng)就(jiù)是(shì):毛茸茸指数 8分,汪汪叫指数 1分,抓老鼠指数 9分。小猫的秘密代号就是:(8, 1, 9)。
你看,“小狗”和“小猫”的秘密代号就不一样。而且,通过比较这些数字,电脑就能“感觉”到它们的不同:哦,一个喜欢汪汪叫,一个擅长抓老鼠!

超级多的“秘密代号”!
刚才我们只用了3个数字来代表小动物。但对于我们人类语言里的每一个词,比如“开心”、“学习”、“天空”、“香蕉”…… 大模型会用超级超级多的数字来给它们“秘密代号”!不是3个,也不是10个,可能是几千个,甚至上万个数字!
在GPT-1 里,每个词用了 768 个数字来表示。在 GPT-3 里,每个词用的是 12288 个数。在 DeepSeekV3 模型里,用的是 7168 个数来表示每个词。
这么多数字,就像给每个词画了一张超级详细的“画像”。电脑虽然看不懂“开心”这两个字,但它能记住“开心”对应的几千个数字代号。
“词嵌入”:把词语放进“数字空间”
科学家们给这种用一大堆数字代表一个词的方法,起了一个酷酷的名字,叫做“词嵌入”,英文叫 Embedding。

“嵌入”是啥意思呢?想象一下我们刚才给小动物打分,如果只用两个分数(比如“毛茸茸指数”和“汪汪叫指数”),我们是不是可以在一张纸上(一个二维平面)画一个点来代表“小狗”,再画一个点代表“小猫”?
▷ 小狗:(毛茸茸7分,汪汪叫9分) -> 在纸上的某个点
▷ 小猫:(毛茸茸8分,汪汪叫1分) -> 在纸上的另一个点
这就好像把“小狗”和“小猫”这两个词,“嵌”入到了这张纸里。
如果用三个分数呢?就像长、宽、高,我们就可以在一个立体空间(比如一个大箱子)里找到一个点来代表它。
而大模型用几千、上万个数字代表一个词,就等于把这个词“嵌”入到了一个超级复杂、我们想象不出来的“高维空间”里!虽然我们画不出来,但在数学上,它是存在的。
数字怎么来的?电脑自己“学”!
那这些代表词语的数字(秘密代号)是怎么定下来的呢?是人一个个设置的吗?当然不是,那太累啦!

大模型在“学习”(训练)的(de)时(shí)候(hou),会(huì)阅(yuè)读(dú)超(chāo)级(jí)多(duō)的(de)文字(zì),比(bǐ)如(rú)图(tú)书(shū)馆(guǎn)里(lǐ)所(suǒ)有(yǒu)的(de)书(shū)、网(wǎng)上(shàng)所(suǒ)有(yǒu)的(de)文章。它会(huì)观(guān)察(chá)哪(nǎ)些(xiē)词经(jīng)常(cháng)一(yī)起(qǐ)出(chū)现(xiàn),哪(nǎ)些(xiē)词意(yì)思(sī)比(bǐ)较(jiào)像(xiàng)。
一开始,所有词的数字代号(hào)都(dōu)是(shì)乱七八糟的。但通过不断阅读和学习,大模型会慢慢调整这些数字,就像整理房间一样,把意思相近的词,它们的“秘密代号”变得也更接近。比如,“高兴”和“快乐”的秘密代号会很像,它们在那个“数字空间”里的位置也会靠得很近。而“高兴”和“桌子”的秘密代号就会差很远。
一词多义怎么办?看“邻居”!
我们知道,有的词有好几个意思,比如“球”,可以指篮球、足球,也可以指地球。电脑怎么知道我们说的是哪个“球”呢?

别担心!当一个词和其他词一起出现时,这些“邻居”词会给它线索。
▷ 如果你说“踢球”,旁边的“踢”这个词的秘密代号,就会和“球”的秘密代号发生一种奇妙的“化学反应”(其实是数学计算),让“球”的代号更偏向“足球”或“篮球”的意思。
▷ 如果你说“地球”,旁边的“地”字就会让“球”的代号指向我们居住的这个星球。
所以,词语的秘密代号不是一成不变的,它会根据上下文,也就是旁边的“邻居”词,进行微小的调整,变得更准确!
总结一下
所以,大模型理解文字的秘密武器就是:
(1)给每个词一大串数字作为“秘密代号”(词嵌入)。
(2)这些数字能表示词语的意思和它们之间的关系。
(3)意思相近的词,它们的“秘密代号”也相近。
(4)电脑通过阅读海量文字,自己学会怎么给词语定(dìng)这(zhè)些(xiē)代(dài)号(hào)。
(5)通(tōng)过词语旁边的“邻居”词,电脑能判断一个词在当前语境下的准确意思。
是不是很有趣?电脑用这种我们看起来有点“笨”的数学方法,竟然就能处理我们复杂又美妙的语言啦!这背后其实是很多聪明的数学和计算在帮忙哦!
供稿单位:重庆市无线电科普体验中心
审核专家:张启义
声明:除原创内容及特别说明之外,部分图片来源网络,非商业用途,仅作为科普传播素材,版权归原作者所有,若有侵权,请联系删除。

公众号

电话
需求反馈