跑ChatGPT体量模型，从此只需一块GPU加速百倍的方法来

爱情常识
搭配分娩
减肥两性
孕期塑形
财经教案
论文美文
日志体育
养生学堂
电商科学
头戴业界
专栏星座
用品音乐

跑ChatGPT体量模型，从此只需一块GPU加速百倍的方法来

　　机器之心报道
　　编辑：泽南
　　1750亿参数，只需要一块RTX3090，ChatGPT终于不再是大厂专属的游戏？
　　计算成本是人们打造ChatGPT等大模型面临的重大挑战之一。
　　据统计，从GPT进化到GPT3的过程也是模型体量增长的过程参数量从1。17亿增加到了1750亿，预训练数据量从5GB增加到45TB，其中GPT3训练一次的费用是460万美元，总训练成本达1200万美元。
　　除了训练，推理也很花钱。有人估算，现在OpenAI运行ChatGPT的算力费用每天就有10万美元。
　　在发展技术，让大模型掌握更多能力的同时，也有人在尝试降低AI所需的算力资源。最近，一种名为FlexGen的技术因为一块RTX3090跑ChatGPT体量模型而获得了人们的关注。
　　虽然FlexGen加速后的大模型看起来仍然很慢跑1750亿参数的语言模型时每秒1个token，但令人印象深刻的是，它已经把不可能变成了可能。
　　传统上，大语言模型（LLM）推理的高计算和内存要求使人们必须使用多个高端AI加速器进行训练。本研究探索了如何将LLM推理的要求降低到一个消费级GPU并实现实用性能。
　　近日，来自斯坦福大学、UCBerkeley、苏黎世联邦理工学院、Yandex、莫斯科国立高等经济学院、Meta、卡耐基梅隆大学等机构的新研究提出了FlexGen，这是一种用于运行有限GPU内存的LLM的高吞吐量生成引擎。
　　通过聚合来自GPU、CPU和磁盘的内存和计算，FlexGen可以在各种硬件资源限制下灵活配置。通过线性规划优化器，它搜索存储和访问张量的最佳模式，包括权重、激活和注意力键值（KV）缓存。FlexGen将权重和KV缓存进一步压缩到4位，精度损失低到可以忽略不计。与最先进的offloading系统相比，FlexGen在单个16GBGPU上运行OPT175B的速度提高了100倍，并首次实现了1tokens的实际生成吞吐量。如果提供了更多的分布式GPU，FlexGen还带有流水线并行runtime，以允许在解码时进行超线性扩展。
　　目前，该技术已经放出代码，获得了几千Star量：https：github。comFMInferenceFlexGen
　　简介
　　近年来，大语言模型在广泛的任务中表现出卓越的性能。LLM在展现出前所未有的通用智能的同时，也让人们在构建时面临着前所未有的挑战。这些模型可能有数十亿甚至数万亿个参数，这导致运行它们需要极高的计算和内存要求。例如，GPT175B（GPT3）仅用于存储模型权重就需要325GB的内存。要让此模型进行推理，至少需要五块英伟达A100（80GB）和复杂的并行策略。
　　降低LLM推理资源需求的方法是最近人们经常讨论的内容。这些努力分为三个方向：
　　（1）模型压缩以减少总内存占用量；
　　（2）协同推理，通过去中心化分摊成本；
　　（3）Offloading以利用CPU和磁盘的内存。
　　这些技术显着降低了使用LLM的计算资源需求。然而，人们通常假设模型适合GPU内存，而现有的基于offloading的系统仍然难以使用单块GPU以可接受的吞吐量运行1750亿参数规模的模型。
　　在新研究中，作者专注于高吞吐量生成推理的有效offloading策略。当GPU显存不够用时，我们需要将其卸载到二级存储，通过部分加载的方式，逐段进行计算。在典型的机器上，内存层次结构分为三级，如下图所示。高级内存速度快但稀缺，低级内存速度慢但充裕。
　　在FlexGen中，作者不追求低延迟，而是瞄准面向吞吐量的场景，这些场景在基准测试、信息提取、数据整理等应用中很受欢迎。实现低延迟对于offloading来说本质上是一个挑战，但是对于面向吞吐量的场景，可以大大提高offloading的效率。图1说明了三个具有offloading的推理系统的延迟吞吐量权衡。通过仔细的调度，IO成本可以通过大量输入分摊并与计算重叠。在研究中，作者展示了就单位算力成本而言，单块消费级GPU吞吐量优化的T4GPU效率要比云上延迟优化的8块A100GPU的效率高4倍。
　　图1。OPT175B（左）和OPT30B（右）上三个基于offloading的系统的延迟和吞吐量权衡。FlexGen实现了新的帕累托最优边界，OPT175B的最大吞吐量提高了100倍。由于内存不足，其他系统无法进一步提高吞吐量。
　　尽管已有研究在训练的背景下讨论了offloading的延迟吞吐量权衡，但尚未有人将其用于生成LLM推理，这是一个截然不同的过程。由于LLM的自回归性质，生成推理提出了独特的挑战。除了存储所有参数外，它还需要顺序解码并维护一个大的注意力键值缓存（KV缓存）。现有的offload系统都无法应对这些挑战，因此它们执行过多的IO，只能实现远低于硬件能力的吞吐量。
　　为生成推理设计良好的offloading策略具有一定挑战性。首先，这个过程中存在三种张量：权重、激活和KV缓存。该策略应指定在三级层次结构上的卸载内容、位置以及卸载时机。其次，逐个batch、逐个token和逐个layer计算的结构形成了一个复杂的依赖图，可以通过多种方式进行计算。该策略应该选择一个可以最小化执行时间的时间表。这些选择共同构成了一个复杂的设计空间。
　　为此，在新方法FlexGen上，人们提出了一种用于LLM推理的offloading框架。FlexGen聚合来自GPU、CPU和磁盘的内存，并能有效地调度IO操作，作者也讨论了可能的压缩方法和分布式管道并行性。
　　该研究的主要贡献如下：
　　1、作者正式定义了可能的offloading策略的搜索空间，并使用成本模型和线性规划求解器搜索最佳策略。值得关注的是，研究人员证明了搜索空间捕获了一个几乎IO最优的计算顺序，其IO复杂度在最优计算顺序的2倍以内。搜索算法可以针对各种硬件规格和延迟吞吐量限制进行配置，从而提供一种平滑导航权衡空间的方法。与现有策略相比，FlexGen解决方案统一了权重、激活和KV缓存的放置，从而实现了更大的batchsize。
　　2、研究表明，可以将OPT175B等LLM的权重和KV缓存压缩到4位，而无需重新训练校准，精度损失可忽略不计。这是通过细粒度分组量化实现的，可以显著降低IO成本。
　　3、通过在英伟达T4GPU（16GB）上运行OPT175B来展示FlexGen的效率。在单块GPU上，给定相同的延迟要求，与DeepSpeedZeroInference（Aminabadietal。，2022）和HuggingFaceAccelerate（HuggingFace，2022）相比，不压缩的FlexGen可以实现高出65倍的吞吐量，后者是目前业内最先进的基于offloading的推理系统。如果允许更高的延迟和压缩，FlexGen可以进一步提高吞吐量并达到100倍的改进。FlexGen是第一个可以使用单块T4GPU为OPT175B实现1tokens速度吞吐量的系统。如果给定多块分布式GPU，具有流水线并行性的FlexGen可在解码时实现超线性扩展。
　　在研究中，作者还将FlexGen和Petals作为offloading和去中心化集合推理方法的代表进行了比较。结果表明，具有单块T4GPU的FlexGen在吞吐量方面胜过具有12块T4GPU的分散式Petal集群，并且在某些情况下甚至可以实现更低的延迟。
　　运行机制
　　通过聚合来自GPU、CPU和磁盘的内存和计算，FlexGen可以在各种硬件资源限制下灵活配置。通过线性规划优化器，它搜索存储和访问张量的最佳模式，包括权重、激活和注意力键值（KV）缓存。FlexGen将权重和KV缓存进一步压缩到4位，精度损失可以忽略不计。
　　FlexGen的一个关键思想是进行延迟吞吐量权衡。实现低延迟对于卸载方法来说本来就具有挑战性，但对于面向吞吐量的场景，可以极大地提升卸载效率（见下图）。FlexGen利用块调度来重用权重并将IO与计算重叠，如下图（b）所示，而其他基线系统使用低效的逐行调度，如下图（a）所示。
　　目前，该研究作者的下一步计划包括对苹果M1、M2芯片的支持和Colab部署的支持。
　　FlexGen自发布后在GitHub上的Star量很快上千，在社交网络上热度也很高。人们纷纷表示这个项目很有前途，似乎运行高性能大型语言模型的障碍正在被逐渐克服，希望在今年之内，单机就能搞定ChatGPT。
　　有人用这种方法训练了一个语言模型，结果如下：
　　虽然没有经过大量数据的投喂，AI不知道具体知识，但回答问题的逻辑似乎比较清晰，或许未来的游戏中，我们能看见这样的NPC？
　　参考内容：https：news。ycombinator。comitem？id34869960

特斯拉幕后的华人老板，财富仅逊马斯克，清华北大有他捐的楼要说近两年全世界最引人眼球的公司是哪家，毫无疑问肯定是特斯拉。随着特斯拉的股价飙升，其创始人马斯克也已经连续两年蝉联世界首富。不过今天我们要说的可不是马斯克，而是特斯拉背后的第3大特斯拉幕后的华人老板，财富仅逊马斯克，清华北大有他捐的楼要说近两年全世界最引人眼球的公司是哪家，毫无疑问肯定是特斯拉。随着特斯拉的股价飙升，其创始人马斯克也已经连续两年蝉联世界首富。不过今天我们要说的可不是马斯克，而是特斯拉背后的第3大美军援打到俄痛处！俄军战损超三分之一，普京亲自下场指挥？美国最近的一项对乌克兰8亿美元的军援落到了实处，也打到了俄罗斯的痛处。在黑海，美国援乌的一种无人隐形艇颇为神秘，号称正成为俄罗斯黑海舰队的最大威胁。据透露，这种无人艇的速度最高可达库列巴欧盟不是乌克兰的希望，乌克兰是欧盟的希望俄乌战争84天，司机总统，库列巴外长总算活明白了，不过，似乎已经晚了，因为，乌克兰国内除的处处废墟，尸横遍野，难民如潮之外，已经再找不到值得炫耀的物件了。这逼装的肠子都悔青了，美国广汽传祺影豹R2022年5月18日，广汽传祺正式宣布影豹Rstyle赛道版正式上市，售13。68万元。新车在原有外形设计的基础上增加了外观运动套件，使其看上去更有赛车视感。值得一提的是，新车在未这个家是我一个人的？女士的法则简沛然1句话揭示中年人无奈导语刚结婚时，因为您是大律师，工作忙，您爸妈就让我牺牲一下，每天准时回来给你做饭照顾一下你，我答应了后来阳阳出生了，我本来有升职的机会，你爸妈又说孩子刚出生，你们母女俩离不开我，又集束炸弹有怎样的威力？多国联名请求销毁，我国拒绝在上面签字炸弹属于一种传统的填充式武器，得到了十分广泛的使用。在引爆之后，会产生非常大的冲击波，还有无数的碎片，有着非常大的杀伤力，破坏力同样也很强。有一种炸弹令很多国家都感到恐惧，那便是集20年2亿多支枪入市！美国民间枪支泛滥成灾美国纽约州布法罗市一名18岁青年制造的超市枪击惨剧震惊全美，政界和民间再次涌现反思枪支管控不力的舆论热潮。然而，总统约瑟夫拜登无奈表示，在他的行政权限内，可做之事不多，只能敦促国会和田玉罗汉，你觉得你更像是哪一位？说到玉雕领域运用广泛的题材，玉佛这一类的题材是必不可少的。在佛教各类人物玉雕艺术中有这样一类显得很是简单朴素，它就是玉罗汉。罗汉，又称阿罗汉，指能断除一切烦恼，达到涅槃境界，不受生建议中老年人，如果不差钱，尽量多吃5种食物，强过天天吃保健品中老年人健康饮食就是要做到吃得好吃得营养吃得全面吃得对！蓉儿建议中老年人如果经济允许，尽量多吃这5种食物，腰腿强壮，营养又健康！1鸡蛋推荐食谱蛋饺食材8个鸡蛋200克猪肉1个白萝卜来自江西的老夫妻来沪看病后流浪街头，只求能回家就好上海一座有温度的城市，为每一个身处其中的人撑起了美好的生活。这曾经是上海的一句口号。温度在人心，你自己清楚。可能每个人站在不同的立场，有不同的看法。在很多外地人眼里，上海是一座神奇

<<<<<<－>>>>>>

浙江这3个城市名字太坑了，虽认识也会念错，看下你知道吗？近些年，浙江省的发展势如破竹，由于地理位置绝佳，位于我国东南沿海地区，是长江三角洲地区的中心城市，经济发展十分迅速，比如省下辖的杭州宁波绍兴温州等城市的知名度很高，特别是省会城市杭他原本是清末的状元，因名字被慈禧嫌弃而落榜，后推翻了清朝辛亥革命爆发后，清朝的统治彻底被推翻，国民党转而建立民国政府。在推翻清朝的人员中，有一位人员极其特殊，他本是清朝大官的后代，甚至还参加了几次科举考试，他原本能够成为状元，却因一个人八十里彩林画廊进入观赏期，免门票就是名字有点尴尬，在四川省内秋日生活打卡季每年的秋末冬初，是一年中观彩林赏红叶的最佳时间。目前在四川省内各地的彩林和红叶都已经进入了今年的观赏时间，在四川众多的彩林中有一个地方的彩林，它被誉为八十里彩林画廊，不期而至将至引期待，彭冠英蔡文静二搭，王劲松李乃文助阵近日，电视剧不期而至宣布定档，这部剧说起来也是非常的受人期待的，作为蔡文静彭冠英二搭的作品，早在当初拍摄的时候，这部剧就得到了不少关注，只不过后来电视剧的热度过去，大家到时也没怎么各大厂商接连放大招！2023年安卓新旗舰你期待哪款？文名动科技文章开头先问大家一个问题，今年各大安卓厂商发布的旗舰机，你满意吗？相信很多人都不太满意，至今为止口碑比较不错的安卓旗舰主要有小米12SUltra三星S22Ultra，但其查尔斯西米克诗歌精选在你的眼皮下，真理是漆黑的查尔斯西米克（CharlesSimic，1938），二十世纪美国著名诗人，生于南斯拉夫，1949年移居美国，曾经在纽约大学学习，1959年开始发表诗作，他曾先后获得过包括普利策诗歌我等着你，却等不到你啊！漠北以北的风雪，一直在梦中哽咽我等着你，我等着那场冬天的雪，我等着你的背影消失在漠北以北。谁还记得你的名字，喀尔喀？谁还记得你的眼泪，色楞格？大漠的风雪迷失了你的眼，西湖的暖风熏红了我的脸。谁还站在杭爱山下，听2023款宝马X2海外曝光，跨界风格更酷炫，全系2。0T引擎，期待在如今的汽车市场中，年轻消费者占据着主流，因此不管是豪华汽车品牌还是一般汽车品牌，都在不断迎合当下年轻消费者的口味。近期，我们也是从相关渠道获悉，宝马旗下的紧凑型SUV车型宝马X3宇宙天体大爆炸发生了，威力大到什么程度？最近宇宙中发生了一场巨大的爆炸，与原子弹的力量相比是无法比拟的。这是恒星在距离地球19亿光年的她方爆炸，并观测和分析发射的光的结果。这种现象，称为加马射线爆发，于1967年首次观测历史上，3000点以下都发生了什么？辉叔看盘大A情绪居然这么差，刚刚略有回暖的市场人气，直接玩了一个倒头杀。很多老乡已经倦了，不想这么耗下去了。但这就是市场的力量，砸盘到让你绝望，没有任何理由可言。市场确实很难，当你买经典款得配货，中年三宝始祖鸟真要对标爱马仕了？有着户外运动品牌爱马仕之称的始祖鸟，这次真的要对标爱马仕了？据虎嗅App报道，一名安踏集团高管在8月的一次活动中半开玩笑地表示未来，始祖鸟在经营策略上会全面对标奢侈品。虽然目前始祖

友情链接：快好找快生活快百科快传网中准网文好找聚热点快软网