咨询服务热线:021-26883548
电话:0755-86673560
邮箱:kaiyuncom@mjchuchen.com
总部:湖北省武汉市东湖新技术开发区高新大道637号
北京科技有限公司:北京市丰台区和义街道和义科创产业园内
上海科技有限公司:上海市静安区新闸路1403号2幢
官方网站-首页
【导语】在AI算力成为发展核心的当下,DeepSeek发布V3.1版本,采用专为提升AI计算效率设计的UE8M0 FP8参数精度,为国产AI算力自主化开辟新路径。该版本不仅在算力优化上取得进展,推动模型进入智能体时代,更助力国产芯片追赶国际水平,是AI算力产业自主化的关键一步。
在人工智能快速发展的时代,算力已成为决定AI技术前进速度的核心要素。近年来,在市场需求和政策支持的驱动下,国内众多企业开始积极探索自主可控的算力解决方案。DeepSeek最新发布的V3.1版本,通过一系列技术创新,在提升模型自身的性能的同时,也为AI算力产业的自主化探索了一条切实可行的路径。
不久前,DeepSeek正式发布其最新版本DeepSeek-V3.1,该版本采用了UE8M0 FP8 Scale的参数精度。DeepSeek官微在置顶留言称,UE8M0 FP8是针对即将发布的下一代国产芯片设计。

UE8M0 FP8的创新价值
UE8M0 FP8是一项专为提升AI计算效率,尤其是在算力受限环境下,而设计的低精度计算技术。其核心是在不显著损失模型精度的前提下,大幅降低内存占用和提升计算速度。
具体来说,FP8表明它是一种8位浮点数,类似于我们熟知的FP16或INT8,但位数更少,能显著降低内存占用和计算资源需求。而UE8M0则精确定义了其格式,U代表无符(Unsigned),只能表示正数和零;E8代表8位指数(Exponent),决定了数值的大小范围;M0代表0位尾数(Mantissa),意味着它没有用于存储精度的尾数位。因此,一个UE8M0格式的数值,其实际表示的数值是2的(de)整(zhěng)数(shù)次(cì)幂(mì),这(zhè)使(shǐ)得(de)它(tā)的(de)数(shù)值(zhí)分(fēn)布(bù)是(shì)离(lí)散(sàn)的(de)指(zhǐ)数(shù)形(xíng)式(shì),而(ér)非(fēi)连(lián)续(xù)的(de)。
可(kě)以(yǐ)借(jiè)助(zhù)一(yī)个(gè)比(bǐ)喻(yù)来(lái)理(lǐ)解(jiě),就(jiù)像(xiàng)会(huì)议(yì)记(jì)录(lù)不(bù)必(bì)逐字抄写,只需记下关键思路与逻辑关系,就能在保留核心信息的同时极大提升效率、节省篇幅。UE8M0在AI芯片中发挥类似作用,以最快速度、最小空间处理对结果影响最大的数值信息,从而在保障准确性的同时实现效率的提升。
目前,已量产的国产AI芯片多数仍以FP16或INT8为主要计算格式,尚未在硬件层面原生支持FP8。然而这一局面正在改变。预计于2025年下半年发布的摩尔线程MUSA 3.1 GPU、芯原VIP9000 NPU等新一代国产芯片,已在宣传中明确列出对原生FP8或Block FP8的支持,并与DeepSeek、华为等15家企业联合验证UE8M0格式。这意味着国产芯片正在计(jì)算(suàn)精(jīng)度(dù)与(yǔ)算(suàn)力(lì)层(céng)面(miàn)加(jiā)速(sù)追(zhuī)赶(gǎn)国(guó)际(jì)先(xiān)进(jìn)水(shuǐ)平(píng)。
尽(jǐn)管(guǎn)如(rú)此(cǐ),带(dài)宽(kuān)仍(réng)是(shì)当(dāng)前(qián)国(guó)产(chǎn)芯(xīn)片(piàn)面(miàn)临(lín)的(de)主要(yào)挑(tiāo)战(zhàn)。与(yǔ)国(guó)际(jì)顶(dǐng)尖(jiān)芯(xīn)片(piàn)相(xiāng)比(bǐ),下(xià)一(yī)代(dài)国产芯片在HBM等高速内存带宽方面仍存在差距。而UE8M0凭借其块缩放(Block Scaling)机制有效应对这一瓶颈,通过将多个FP8数值成组处理,共用同一缩放因子,而非逐个配置,大幅降低了数据传输需求。
在有限带宽条件下,UE8M0显著减(jiǎn)少(shǎo)了(le)非(fēi)必(bì)要(yào)的(de)数(shù)据(jù)搬(bān)运(yùn)开(kāi)销(xiāo),使(shǐ)带(dài)宽(kuān)资(zī)源(yuán)更(gèng)集中(zhōng)于(yú)核(hé)心(xīn)运(yùn)算(suàn),因(yīn)而(ér)被(bèi)视(shì)为(wèi)下(xià)一(yī)代(dài)芯(xīn)片(piàn)架(jià)构(gòu)的(de)关键优(yōu)化(huà)方(fāng)向(xiàng)。对正处于追赶阶段的国产芯片来说,支持并优化UE8M0这类高效格式,无疑是通过算法创新弥补硬件短板、实现弯道超车的重要路径。
迈向智能体新时代
DeepSeek-V3.1不仅在算力优化方面取得了进展,还在模型能力上实现了重要突破,推动其进入智能体时代。智能体是一种比普通对话模型更高级的形态,能够像人类一样判断任务、调用工具并自主思考。
1、混合推理架构的创新
以往的模型通常只能擅长简单回答或复杂问题中的一种,而V3.1实现了同一模型同时支持两种模式,并能自动判断使用哪种模式。例如,对于简单查询,模型会使用快速响应模式;而对于复杂任务,则会启用深度思考模式进行推理。这种混合架构不仅降低了响应时间,还减少了计算资源消耗,从而降低了运营成(chéng)本(běn)。
2、增(zēng)强(qiáng)企(qǐ)业(yè)级(jí)服(fú)务(wu)能(néng)力(lì)
DeepSeek-V3.1在(zài)企(qǐ)业(yè)级(jí)应(yīng)用(yòng)方(fāng)面(miàn)表(biǎo)现(xiàn)出(chū)色(sè)。其(qí)支(zhī)持(chí)严(yán)格(gé)模(mó)式(shì)的(de)函(hán)数(shù)调(diào)用(yòng)功(gōng)能(néng),确(què)保(bǎo)模(mó)型(xíng)在(zài)调(diào)用(yòng)外(wài)部(bù)工(gōng)具(jù)(如(rú)查(chá)询(xún)企(qǐ)业(yè)数据库)时输出的结果完全符合预设格式,避免了数据错误,满足了企业用户对稳定性和准确性的核心需求。同时,V3.1兼容国际主流API格式,这意味着原本使用其他框架的企业可以无缝切换到DeepSeek,无需修改现有系统,从而帮助DeepSeek吸引更多企业用户。
3、基础性能的全面提升
V3.1在V3的基础上新增8400亿tokens训练,显著提升了模型的能力。其上下文长度达到128k,并同时支持快速模式和深度思考模式。尽管性能大幅提升,但DeepSeek依然坚持高性价比路线,价格进一步下调,巩固了其在国内AI开源领域的领先地位。
因此,DeepSeek-V3.1不仅在技术层面实现了重要突破,更在推动国产算力生态建设、降低对外部硬件依赖方面展现了切实的推动力。
写在最后:
DeepSeek-V3.1的发布不仅仅是一次技术升级,更是AI算力产业自主化探索的关键一步。对DeepSeek自身而言,V3.1推动其从基础大模型迈入智能体时代,增强了在企业市场的竞争力;对AI产业来说,低精度技(jì)术(shù)创(chuàng)新(xīn)为(wèi)国(guó)产(chǎn)芯(xīn)片(piàn)的(de)高(gāo)效(xiào)运(yùn)行(xíng)提(tí)供(gōng)了(le)可(kě)能(néng)。
供(gōng)稿(gǎo)单(dān)位(wèi):重(zhòng)庆(qìng)天(tiān)极(jí)网(wǎng)络(luò)有(yǒu)限(xiàn)公(gōng)司(sī)
审(shěn)核(hé)专(zhuān)家(jiā):李(li)志(zhì)高(gāo)
声(shēng)明(míng):除(chú)原(yuán)创(chuàng)内(nèi)容及特别说明之(zhī)外,部分图片来源网络,非商业用途,仅作为科普传播素材,版权归原作者所有,若有侵权,请联系删除。

公众号

电话
需求反馈