咨询服务热线:021-26883548
电话:0755-86673560
邮箱:kaiyuncom@mjchuchen.com
总部:湖北省武汉市东湖新技术开发区高新大道637号
北京科技有限公司:北京市丰台区和义街道和义科创产业园内
上海科技有限公司:上海市静安区新闸路1403号2幢
官方网站-首页
【导语】人工智能(AI)与组合优化正引领科学研究与工业应用的飞速发展,但其能耗问题日益凸显,对数字计算的可持续性构成挑战。当前新型计算系统往往局限于单一领域,且频繁的数字转换导致效率低下。微软英国剑桥研究院团队提出的“模拟光学计算机”(AOC),打破了这一局限,实现了AI推理与组合优化任务的高效并行处理,无需数字转换,展现出显著的能效优势。相关研究已发表于Nature期刊,为更高速、更可持续的计算提供了新路径。AOC结合3D光学与模拟电子技术,面向机器学习与优化任务,展现出强大的应用潜力,有望在能效方面实现百倍提升,推动硬件与算法的创新协同发展。

人工智能(AI)和组合优化正在推动科学研究和工业应用的快速发展,但它们日益增长的能耗也对数字计算的可持续性提出了严峻挑战。
同时,目前大多数新型计算系统要么只擅长 AI,要么只擅长优化,而且还需频繁进行高能耗的数字转换,效率受限。另外,在实际应用中,这些系统也常难与硬件高效配合,无论是处理内存受限的神经网络、解决复杂优化问题,还是应对模拟计算噪声,都表现不佳。
如果换一种思路,不再依赖“0”与“1”的切换,而是用光与模拟信号去计算呢?这种不需要频繁转换、不依赖数字逻辑的计算方式,能否打破现有的限制?
基于此,微软英国剑桥研究院团(tuán)队(duì)及其合作者提出了“模拟光学计算机”(Analog Optical Computer,AOC),其在无需数字转换的情况下,能够同时高效完成 AI 推理与组合优化任务,并具备显著的扩展潜力与能效优势。
相关研究论文已发表在权威科学期刊 Nature 上。上海交大校友、微软英国剑桥研究院首席研究员褚嘉琦(Jiaqi Chu)为该论文的作者之一。

据介绍,AOC 实现了将模拟电子技术与三维光学技术相结合,使同一平台能够同时加速 AI 推理和组合优化任务。这种“双领域能力”得益于快速的定点搜索方法,无需数字转换,同时也增强抗噪声能(néng)力(lì)。基(jī)于(yú)这(zhè)种(zhǒng)定点抽象,AOC 可运行具备递归推理能力的新型计算密集型神经模型,并采用先进的梯度下降方法解决高表现力优化问题。

图|AOC 架构与应用示意图
研究团队表示,AOC 架构基于可扩展的消费级技术构建,为实现更高速、更可持续的计算提供了有前景的(de)路径。其(qí)原(yuán)生(shēng)支(zhī)持迭代式、计算密集型模型,为 AI 与优化领域的未来创新提供了可扩展的模拟计算平台。
模拟光学计算机:如何加速AI和优化任务?
AOC 在应用层面主要面向两类任务:机器学习推理任务和组合优化任务。研究团队通过四个典型案例展示了 AOC 在这两类任务中的能力。这项研究也体现了硬件与抽象层协同设计的优势,呼应了数字加速器与深度学习模型共同演进的趋势。
AOC 硬件结合了 3D 光学技术与模拟电子技术,并基于平衡模型实现了两个机器学习推理任务:图像分类与非线性回归。在这两项任务中,模型均通过 AOC-DT 进行数字训练,并直接部署到硬件上,无需进一步校准。这对硬件精度提出了较高要求,同时也要求 AOC-DT 具备较高的保真度。
在图像分类实验中,AOC 的结果证(zhèng)明(míng)了(le)采用(yòng)数(shù)字(zì)训(xun)练(liàn)并(bìng)将(jiāng)权(quán)重(zhòng)转(zhuǎn)移(yí)至(zhì)光(guāng)电(diàn)模(mó)拟(nǐ)推(tuī)理(lǐ)硬(yìng)件(jiàn)的(de)可(kě)行(xíng)性(xìng)。将(jiāng) AOC 的(de)结(jié)果(guǒ)与(yǔ)线(xiàn)性(xìng)分(fēn)类(lèi)器(qì)进(jìn)行(xíng)比(bǐ)较时,运行在 AOC 上的平衡模型所作出的贡献更加明显。研究人员还训练了一个简单的前馈模型,线性分类器和前馈模型都具有与 AOC 硬件相同数量的参数。尽管 AOC 实现了略高的准确率,但 MNIST 和 Fashion-MNIST 数据集本身较为简单,难以充分展现自递归模型的全部潜力。
**研究表明,AOC 硬件可以运行非线性回归模型。**他们选择两个非线性函数进行回归:高斯曲线和正弦曲线。**硬件准确地重现了这两个函数。**相比高斯曲线,正弦曲线由于存在多个极小值和极大值,对拟合精度提出了更高要求(qiú),因(yīn)此(cǐ)需(xū)要(yào)更(gèng)高(gāo)精(jīng)度(dù)的(de)可(kě)微(wēi)分(fēn)数(shù)字(zì)孪(luán)生(shēng)模(mó)型(xíng)(AOC-DT)。此(cǐ)外(wài),AOC 为(wèi)运(yùn)行(xíng)在(zài)硬(yìng)件(jiàn)上(shàng)的(de)平(píng)衡(héng)模型提供了支持。

图|AOC 在机器学习推理中的应用
QUMO 代表了一类广泛的组合优化问题,旨在最小化目标函数,QUMO 问题的求解过程即为找到一组使目标函数最小化的变量赋值。研究团队在 AOC 硬件上展示了两个典型的 QUMO 应用场景:医学图像重建与金融交易结算。
他们在 AOC 硬件上实现了压缩感知,这是一种可以用更少的测量实现准确信号重建的技术。最终的图像重建结果与原始线条高度一致。所有 QUMO 实例均以完全模拟方式求解,未使用任何数字后处理。为了验证压缩感知在大规模下的 QUMO 表达形式,研究人员使用 AOC-DT 从 FastMRI 数据集中重建了一幅脑部扫描图像。这一问题包含超过 200000 个变量。在典型的 4 倍和 8 倍欠采样率下,重建的均方误差(MSE)均低于 0.07。
在金(jīn)融(róng)领(lǐng)域的(de)优(yōu)化(huà)任(rèn)务(wu)中(zhōng),他(tā)们(men)使(shǐ)用(yòng) AOC 硬(yìng)件(jiàn)解(jiě)决(jué)了(le)一(yī)个(gè)交(jiāo)易(yì)结(jié)算(suàn)问(wèn)题(tí)。每(měi)一(yī)笔(bǐ)证(zhèng)券(quàn)交(jiāo)易(yì)都(dōu)是(shì)以(yǐ)支(zhī)付(fù)换(huàn)取(qǔ)证(zhèng)券(quàn)的(de)交(jiāo)换(huàn),清(qīng)算(suàn)所(suǒ)会(huì)处(chù)理(lǐ)这(zhè)类(lèi)交(jiāo)易(yì)的(de)批(pī)次(cì),在(zài)每(měi)个(gè)交(jiāo)易(yì)批(pī)次(cì)中(zhōng),交(jiāo)易(yì)结(jié)算(suàn)的(de)目(mù)标(biāo)是(shì)最(zuì)大(dà)化(huà)已(yǐ)结(jié)算交易的总数或总价值。鉴于交易数量庞大,同时受到法律约束和其他附加要求的限制,这成为一项复杂的优化问题。在该交易结算场景中,AOC 硬件在 7 个块坐标下降法(BCD)步骤内找到了全局最优解。相(xiāng)比(bǐ)之(zhī)下(xià),量(liàng)子(zi)硬(yìng)件(jiàn)在(zài)相(xiāng)同(tóng)问(wèn)题(tí)上(shàng)的(de)成(chéng)功(gōng)率(lǜ)仅(jǐn)为(wèi) 40–60%。

图|AOC 在优化中的应用
利用 AOC-DT,研究人员还在 QPLIB 基准测试中最难的具有线性不等式约束的二次二元问题上验证了算法性能,这些问题被表述为 QUMO 实例。AOC 方法与商用求解器 Gurobi 进行了对比,后者在这些问题上通常需要超过一分钟才能达到当前已知的最优解。
这种全模拟操作最大限度地减少了模数转换的开(kāi)销(xiāo)。
未(wèi)来(lái)潜力:实现100倍能效提升
值得注意的是,现实应用对硬件的扩展能力提出了更高要求。使用 AOC 处理实际任务,需要其硬件能够支持从数亿到数十亿个权重的可扩展性。
研究团队表示,AOC 通过模块化架构具备满足这一需求的潜力,该架构可将核心的光学矩阵–向量乘法运算分解为较小的子向(xiàng)量(liàng)与(yǔ)子(zi)矩(ju)阵(zhèn)乘(chéng)法(fǎ),从(cóng)而(ér)实(shí)现(xiàn)可(kě)扩(kuò)展(zhǎn)的(de)内(nèi)存(cún)计(jì)算(suàn)。
研(yán)究(jiū)团(tuán)队(duì)预(yù)计(jì),AOC 可(kě)支(zhī)持参数规模在 1 亿至 20 亿之间的模型,对应需要 50 至 1000 个光学模块。如果单个光学模块能够同时处理正负权重,则所需模块数量可减少一半。AOC 所采用的所有组件,包括 microLED、光电探测器、SLM 及模拟电子器件,均已具备持续扩展的制造生态系统,能够支持晶圆级的生产。
AOC 的运行速度和功耗决定了其能效。其速度受光电组件带宽限制,通常为 2 GHz 或更高。对于一个 1 亿权重的矩阵,使用 25 个 AOC 模块时,功耗估计为 800 W,可实现 400 Peta-OPS 的计算速度,在 8 位权重精度下的能效为每瓦 500 TOPS。相比之下,最新的 GPU 在相同精度下处理稠密矩阵时,其系统能效最高仅为每瓦 4.5 TOPS。
总之,AOC 架构在扩展到实际的机器学习和优化任务方面展现出良好前景,有望在能(néng)效(xiào)方(fāng)面(miàn)实(shí)现(xiàn)约(yuē) 100 倍(bèi)的(de)提(tí)升(shēng)。
展(zhǎn)望(wàng)未(wèi)来(lái),AOC 的(de)协(xié)同(tóng)设(shè)计(jì)方(fāng)法(fǎ)——将(jiāng)硬(yìng)件(jiàn)与(yǔ)机(jī)器(qì)学习和优化算法紧密对齐——有望持续推动硬件与算法的创新飞(fēi)轮(lún),这(zhè)对(duì)实(shí)现(xiàn)可(kě)持(chí)续(xù)计(jì)算(suàn)至(zhì)关重(zhòng)要(yào)。
注(zhù)意(yì):封(fēng)面(miàn)图(tú)为(wèi)版(bǎn)权(quán)图(tú)库(kù)图(tú)片(piàn),转(zhuǎn)载使用可能引发版权纠纷。
公众号

电话
需求反馈