咨询服务热线:021-26883548
电话:0755-86673560
邮箱:kaiyuncom@mjchuchen.com
总部:湖北省武汉市东湖新技术开发区高新大道637号
北京科技有限公司:北京市丰台区和义街道和义科创产业园内
上海科技有限公司:上海市静安区新闸路1403号2幢
官方网站-首页
·研(yán)究人员发现,在生物医疗领域,尽管“定制版”垂(chuí)类(lèi)模(mó)型(xíng)应(yīng)用(yòng)对(duì)于(yú)医(yī)学(xué)自(zì)然(rán)语(yǔ)言(yán)处(chù)理(lǐ)上(shàng)仍(réng)有(yǒu)优(yōu)势(shì),但(dàn)涉(shè)及(jí)复(fù)杂(zá)的(de)推(tuī)理(lǐ),尤(yóu)其(qí)是(shì)医(yī)学(xué)问(wèn)答(dá)方(fāng)面(miàn),闭(bì)源(yuán)通(tōng)用(yòng)大(dà)模(mó)型(xíng)GPT-4则(zé)更(gèng)有(yǒu)明(míng)显(xiǎn)优(yōu)势(shì)。

记(jì)者(zhě) 蒋(jiǎng)立(lì)冬(dōng) AI创(chuàng)意(yì)
大(dà)模(mó)型(xíng)在(zài)生(shēng)物(wù)医(yī)疗(liáo)领(lǐng)域的(de)应(yīng)用(yòng)情(qíng)况(kuàng)如(rú)何(hé)?哪(nǎ)种(zhǒng)模(mó)型(xíng)更(gèng)加(jiā)适(shì)用(yòng)?4月(yuè)6日(rì),《自(zì)然(rán)·通(tōng)讯(xùn)》(Nature Communications)杂(zá)志(zhì)刊(kān)登(dēng)了(le)一(yī)项(xiàng)由(yóu)耶(yé)鲁(lǔ)大(dà)学(xué)医(yī)学(xué)院(yuàn)的(de)研(yán)究(jiū)人(rén)员(yuán)对(duì)大(dà)语(yǔ)言(yán)模(mó)型(xíng)(LLMs)在(zài)生(shēng)物(wù)医(yī)学(xué)自(zì)然(rán)语(yǔ)言(yán)处(chù)理(lǐ)(BioNLP)中(zhōng)的(de)全面(miàn)评(píng)估(gū)与(yǔ)应(yīng)用(yòng)指(zhǐ)南(nán)(《Benchmarking large language models for biomedical natural language processing applications and recommendations》,以(yǐ)下简称“指南”)。在该份指南中,研究人员选择了12个来自 BioNLP 不同应用领域的数据集,评估了四种具有代表性的大模型GPT-3.5、GPT-4、LLaMA 2 和 PMC LLaMA在零样本、少样本和微调设置下的性能。
生物医学自然语言处理(BioNLP)技术是一种将自然语言处理技术应用于生物医学领域的交叉学科技术,核心是(shì)从(cóng)大(dà)量(liàng)的生物医学文本比如医学论文、电子病历、基因数据库等中自动提取有用的信息。
研究人员发现,在生物医疗领域,仅靠持续扩充预训练数据并不能显著提升开源生物医学大语言模型的整体表现,针对具体医学任务的微调才是关键。比如生物医学领域特定大模型的代表PMC -LLaMA,使用了32个A100 GPU对模型进行预训练,但最终评估并未发现该模型的性能有显著提升。PMC -LLaMA是由上海交通大学长聘轨副教授谢伟迪研究团队于(yú)2023年(nián)4月(yuè)研发的垂类模型,基座模型使用的是LLaMA 2;研究人员发现,直接微调LLaMA 2可以获得更好或至少相似的性能。通过微调,模型可以针对性地学习医学领域的专业知识和复杂推理要求,从而在信息抽取、医学问答等任务上实现显著性能提升。
研究人员建议,未来在生物医疗应用中,应更多关注如何优化微调策略,以弥补预训练在处理专业医学文本时的不足。“需要一种更有效、更可持续的方法来开发特定于生物医学领域的大语言模型。”研究人员称。
相较于通用大模型,针对生物医疗领域里的“定制版”模型BioBERT和PubMedBERT(注释:Bert是一款由谷歌开发的预训练语言模型),在医学自然语言处理表现更出色。由于经过专业的医学数据训练,BioBERT和PubMedBERT这类“定制版”模型能够更精准地识别疾病名称、基因、化学物质以及理解医学术语,这一点表现比GPT-3.5和GPT-4为代表的通用大型语言模型更好。但涉及较为复杂的推理任务,尤其是医学问答方面,GPT-4则更有明显优势,能够“看懂并能思考”,生成更合理以及准确的回应。
对于生物医药行业普遍关心的大模型幻觉问题,此次研究结果表明,GPT-4在两个数据集上几乎没有出现幻觉问题。在零样本条件下,通用开源模型LLaMA 2则更容易出现幻觉问题,比如输出时常常出现信息不完整、格式不一致或提示无关内容的情况,它产生的幻觉案例约占测试样本的32%,比例远超GPT-3.5和GPT-4。
尽管GPT-4在众多评估任务中表现优异,但研究人员指出,其调用成本相当于GPT-3.5的60至100倍。对于预算有限的实际应用场景,医学机构可能会倾向于选用成本较低且效果可接受的GPT-3.5;而(ér)对于准确性要求极高、尤其是医学问答这类依赖复杂推理的任务中,GPT-4可能会是更理想的选择。
公众号

电话
需求反馈