跑ChatGPT体量模型，从此只需一块GPU加速百倍的方法来了

　　机器之心报道
　　编辑：泽南
　　1750 亿参数，只需要一块 RTX 3090，ChatGPT 终于不再是大厂专属的游戏？
　　计算成本是人们打造 ChatGPT 等大模型面临的重大挑战之一。
　　据统计，从 GPT 进化到 GPT-3 的过程也是模型体量增长的过程 —— 参数量从 1.17 亿增加到了 1750 亿，预训练数据量从 5GB 增加到 45TB，其中 GPT-3 训练一次的费用是 460 万美元，总训练成本达 1200 万美元。
　　除了训练，推理也很花钱。有人估算，现在 OpenAI 运行 ChatGPT 的算力费用每天就有 10 万美元。
　　在发展技术，让大模型掌握更多能力的同时，也有人在尝试降低 AI 所需的算力资源。最近，一种名为 FlexGen 的技术因为「一块 RTX 3090 跑 ChatGPT 体量模型」而获得了人们的关注。
　　虽然 FlexGen 加速后的大模型看起来仍然很慢 —— 跑 1750 亿参数的语言模型时每秒 1 个 token，但令人印象深刻的是，它已经把不可能变成了可能。
　　传统上，大语言模型（LLM）推理的高计算和内存要求使人们必须使用多个高端 AI 加速器进行训练。本研究探索了如何将 LLM 推理的要求降低到一个消费级 GPU 并实现实用性能。
　　近日，来自斯坦福大学、UC Berkeley、苏黎世联邦理工学院、Yandex、莫斯科国立高等经济学院、Meta、卡耐基梅隆大学等机构的新研究提出了 FlexGen，这是一种用于运行有限 GPU 内存的 LLM 的高吞吐量生成引擎。
　　通过聚合来自 GPU、CPU 和磁盘的内存和计算，FlexGen 可以在各种硬件资源限制下灵活配置。通过线性规划优化器，它搜索存储和访问张量的最佳模式，包括权重、激活和注意力键 / 值（KV）缓存。FlexGen 将权重和 KV 缓存进一步压缩到 4 位，精度损失低到可以忽略不计。与最先进的 offloading 系统相比，FlexGen 在单个 16GB GPU 上运行 OPT-175B 的速度提高了 100 倍，并首次实现了 1 token/s 的实际生成吞吐量。如果提供了更多的分布式 GPU，FlexGen 还带有流水线并行 runtime，以允许在解码时进行超线性扩展。
　　目前，该技术已经放出代码，获得了几千 Star 量：https://github.com/FMInference/FlexGen
　　简介
　　近年来，大语言模型在广泛的任务中表现出卓越的性能。LLM 在展现出前所未有的通用智能的同时，也让人们在构建时面临着前所未有的挑战。这些模型可能有数十亿甚至数万亿个参数，这导致运行它们需要极高的计算和内存要求。例如，GPT-175B（GPT-3）仅用于存储模型权重就需要 325GB 的内存。要让此模型进行推理，至少需要五块英伟达 A100（80GB）和复杂的并行策略。
　　降低 LLM 推理资源需求的方法是最近人们经常讨论的内容。这些努力分为三个方向：
　　（1）模型压缩以减少总内存占用量；
　　（2）协同推理，通过去中心化分摊成本；
　　（3）Offloading 以利用 CPU 和磁盘的内存。
　　这些技术显着降低了使用 LLM 的计算资源需求。然而，人们通常假设模型适合 GPU 内存，而现有的基于 offloading 的系统仍然难以使用单块 GPU 以可接受的吞吐量运行 1750 亿参数规模的模型。
　　在新研究中，作者专注于高吞吐量生成推理的有效 offloading 策略。当 GPU 显存不够用时，我们需要将其卸载到二级存储，通过部分加载的方式，逐段进行计算。在典型的机器上，内存层次结构分为三级，如下图所示。高级内存速度快但稀缺，低级内存速度慢但充裕。
　　在 FlexGen 中，作者不追求低延迟，而是瞄准面向吞吐量的场景，这些场景在基准测试、信息提取、数据整理等应用中很受欢迎。实现低延迟对于 offloading 来说本质上是一个挑战，但是对于面向吞吐量的场景，可以大大提高 offloading 的效率。图 1 说明了三个具有 offloading 的推理系统的延迟吞吐量权衡。通过仔细的调度，I/O 成本可以通过大量输入分摊并与计算重叠。在研究中，作者展示了就单位算力成本而言，单块消费级 GPU 吞吐量优化的 T4 GPU 效率要比云上延迟优化的 8 块 A100 GPU 的效率高 4 倍。
　　图 1. OPT-175B（左）和 OPT-30B（右）上三个基于 offloading 的系统的延迟和吞吐量权衡。FlexGen 实现了新的帕累托最优边界，OPT-175B 的最大吞吐量提高了 100 倍。由于内存不足，其他系统无法进一步提高吞吐量。
　　尽管已有研究在训练的背景下讨论了 offloading 的延迟 - 吞吐量权衡，但尚未有人将其用于生成 LLM 推理，这是一个截然不同的过程。由于 LLM 的自回归性质，生成推理提出了独特的挑战。除了存储所有参数外，它还需要顺序解码并维护一个大的注意力键 / 值缓存（KV 缓存）。现有的 offload 系统都无法应对这些挑战，因此它们执行过多的 I/O，只能实现远低于硬件能力的吞吐量。
　　为生成推理设计良好的 offloading 策略具有一定挑战性。首先，这个过程中存在三种张量：权重、激活和 KV 缓存。该策略应指定在三级层次结构上的卸载内容、位置以及卸载时机。其次，逐个 batch、逐个 token 和逐个 layer 计算的结构形成了一个复杂的依赖图，可以通过多种方式进行计算。该策略应该选择一个可以最小化执行时间的时间表。这些选择共同构成了一个复杂的设计空间。
　　为此，在新方法 FlexGen 上，人们提出了一种用于 LLM 推理的 offloading 框架。FlexGen 聚合来自 GPU、CPU 和磁盘的内存，并能有效地调度 I/O 操作，作者也讨论了可能的压缩方法和分布式管道并行性。
　　该研究的主要贡献如下：
　　1、作者正式定义了可能的 offloading 策略的搜索空间，并使用成本模型和线性规划求解器搜索最佳策略。值得关注的是，研究人员证明了搜索空间捕获了一个几乎 I/O 最优的计算顺序，其 I/O 复杂度在最优计算顺序的 2 倍以内。搜索算法可以针对各种硬件规格和延迟 / 吞吐量限制进行配置，从而提供一种平滑导航权衡空间的方法。与现有策略相比，FlexGen 解决方案统一了权重、激活和 KV 缓存的放置，从而实现了更大的 batch size。
　　2、研究表明，可以将 OPT-175B 等 LLM 的权重和 KV 缓存压缩到 4 位，而无需重新训练 / 校准，精度损失可忽略不计。这是通过细粒度分组量化实现的，可以显著降低 I/O 成本。
　　3、通过在英伟达 T4 GPU (16GB) 上运行 OPT-175B 来展示 FlexGen 的效率。在单块 GPU 上，给定相同的延迟要求，与 DeepSpeed Zero-Inference (Aminabadi et al., 2022) 和 Hugging Face Accelerate (HuggingFace, 2022) 相比，不压缩的 FlexGen 可以实现高出 65 倍的吞吐量，后者是目前业内最先进的基于 offloading 的推理系统。如果允许更高的延迟和压缩，FlexGen 可以进一步提高吞吐量并达到 100 倍的改进。FlexGen 是第一个可以使用单块 T4 GPU 为 OPT-175B 实现 1 token/s 速度吞吐量的系统。如果给定多块分布式 GPU，具有流水线并行性的 FlexGen 可在解码时实现超线性扩展。
　　在研究中，作者还将 FlexGen 和 Petals 作为 offloading 和去中心化集合推理方法的代表进行了比较。结果表明，具有单块 T4 GPU 的 FlexGen 在吞吐量方面胜过具有 12 块 T4 GPU 的分散式 Petal 集群，并且在某些情况下甚至可以实现更低的延迟。
　　运行机制
　　通过聚合来自 GPU、CPU 和磁盘的内存和计算，FlexGen 可以在各种硬件资源限制下灵活配置。通过线性规划优化器，它搜索存储和访问张量的最佳模式，包括权重、激活和注意力键 / 值 (KV) 缓存。FlexGen 将权重和 KV 缓存进一步压缩到 4 位，精度损失可以忽略不计。
　　FlexGen 的一个关键思想是进行延迟 - 吞吐量权衡。实现低延迟对于卸载方法来说本来就具有挑战性，但对于面向吞吐量的场景，可以极大地提升卸载效率（见下图）。FlexGen 利用块调度来重用权重并将 I/O 与计算重叠，如下图 (b) 所示，而其他基线系统使用低效的逐行调度，如下图 (a) 所示。
　　目前，该研究作者的下一步计划包括对苹果 M1、M2 芯片的支持和 Colab 部署的支持。
　　FlexGen 自发布后在 GitHub 上的 Star 量很快上千，在社交网络上热度也很高。人们纷纷表示这个项目很有前途，似乎运行高性能大型语言模型的障碍正在被逐渐克服，希望在今年之内，单机就能搞定 ChatGPT。
　　有人用这种方法训练了一个语言模型，结果如下：
　　虽然没有经过大量数据的投喂，AI 不知道具体知识，但回答问题的逻辑似乎比较清晰，或许未来的游戏中，我们能看见这样的 NPC？
　　参考内容：https://news.ycombinator.com/item?id=34869960

这种可怕的原因，让地球生命陷入黑暗时刻大约2。5亿年前，二叠纪末期，一次全球性的集群灭绝事件抹掉了当时地球上80的海洋和陆地物种。它通常被认为是已知的大灭绝事件中最严重的一次。这种生物多样性的灾难性损失，实际上是一种对本地生活服务之抖音外卖团购开放类目平台抽佣三大变化来看最近关于抖音外卖侧，消息也比较多，大家也都在期待上线开放，按照现在平台计划，预计上线时间在三月份左右，主要以一二线城市为主，三四线城市具体等待平台通知，关于外卖侧，商家去做上架开通PS5迎来系统更新支持精英手柄了PS5精英手柄DualsenseEdge将于本月26日正式推出，国行售价1599元。PS5也推出了系统更新，新增了对这款手柄的支持。补丁版本22。0206。50。00支持DualS新春走基层畲族风情入画中，余江这颗石榴籽美爆了小溪绕村潺潺穿行，竹林成片果林飘香，畲族图腾的雕塑铸牢中华民族共同体意识绘画随处可见，象征五十六个民族共同信仰的火炬雕塑仿佛在燃烧1月12日，记者走进余江少数民族村庄潢溪镇店前雷家OPPOWatch3系列再加强！全面支持微信手表版，体验直追AppleWatch众所周知，苹果的产品和其他同类型产品相比价格更贵，iPhoneiPadAppleWatch都是如此。这里面除了品牌溢价之外，苹果所提供的服务和体验也是顶级的，所以很多消费者愿意为之苹果还是安卓？年末换新机看过来，Reno9系列这些体验不输苹果即使是当时间来到了2023年，仍有不少人对于iPhone安卓手机存在一些误解。比如iPhone一定比安卓手机更流畅，用几年时间也不卡顿，亦或者是iPhone之所以不用高功率快充，目年味儿越来越足！灵丘县车河村晚开始搭建舞台啦！黄河新闻网大同讯（记者安青）以启航新征程幸福中国年为主题的京西福地山水灵丘2023全国村晚示范展示活动车河村村晚开始搭建舞台，布置现场，年味儿越来越足。冬日的车河村阳光普照，明媚祥30年过去了，你对赵雅芝新白娘子传奇的影响力一无所知娱乐圈考古记多年后，当赵雅芝在节目中分享自己演白娘子时是怎样施法的，应该总会想起自己读介绍观音书籍的那段日子。导演对赵雅芝和陈美琪说，她俩要演的白蛇和青蛇是会法术的，但究竟要怎么施生肖酒被酒企热捧真好or凑热闹？舍得月销1000，珍酒仅卖出2瓶春节临近，生肖酒再次成为白酒行业的热词。在持续火了多年以后，越来越多的酒企开始入局生肖酒。截至目前，五粮液泸州老窖舍得郎酒赊店等酒企纷纷推出兔年生肖酒产品，争抢兔年生肖酒赛道。而作春节临近，生肖酒市场喜忧参半，何故呢？距春节之日屈指可数，生肖酒在各大销售渠道活跃起来。目前来看，五粮液泸州老窖洋河郎酒古井贡酒等酒企纷纷推出兔年生肖酒产品，茅台则尝鲜元宇宙，推出巽风数字世界客户端，并于线上线下同步举生肖腕表从收藏到穿戴宝珀全新中华年历限量款宝兔腕表新款腕表由铂金打造而成，限量发行50枚，表盘上呈现了干支纪年阴阳合历十二时辰生肖五行等中华年历独有显示功能，摆陀上还镌刻有一对栩栩如生的宝兔图案。PI

<<<<<<－>>>>>>

如何培养出情商高性格好的孩子？14个很有用的方法与技巧，转给家长情商高的孩子，往往更自信，在生活中也会更受欢迎。而培养高情商，永远离不开家长的用心养育。人与人之间的情商并无明显的先天差别，更多与后天的培养息息相关。因此，在情商培养的过程中，灵活做中视频，如何每个月稳定的赚1万左右？透露一个简单粗暴的方法川叫兽轻资产创业资深专业玩家。目标让十万人实现月入过万！做短视频，认准一个方向以后只要坚持死磕到底，就百分之百能赚到钱，不需要到处拜师四处研究，研究得越多就越迷茫，越不知道该怎么下马尔卡宁38分爵士力克太阳！布克空砍49810NBA常规赛11月19日继续进行，最终，爵士以134133战胜太阳，爵士终结3连败。首节开始，爵士上来连续命中中远投打出258开局！布克迅速连拿7分率队回敬一波229迫近比分。各拿称重仪式结束，前世界拳王蒙圭亚明天将继续在中量级比赛北京时间2022年11月19日凌晨，在墨西哥瓜达拉哈拉举行的职业拳击中量级比赛的赛前称重仪式中，前WBO超次中量级世界拳王拳王杰米蒙圭亚和他的对手阿根廷拳手冈萨洛科里亚（GonzaCBA最新消息！上海更换教练，胡金秋第二阶段报销，杨鸣惹争议CBA第一阶段结束之后，大部分球队都开始了调整，有更换外援的，有裁掉多余球员的，也有更换教练的。而上海男篮无疑是最忙碌的球队，他们先是裁掉了比斯利和富兰克林，随后引进了布莱德索和奥樊振东透露加盟上海队始末，放眼未来他还有很多期许樊振东的每一条新闻总有颇高关注度。在最新一期国际乒联积分榜上，樊振东以7700分稳居男单第一。随后，他又登上巴黎奥运会最新发布的官方海报。他还在社交平台公开呼吁希望大家从竞技体育中18中15砍38分6板！范德比尔特马尔卡宁是全明星就是这样直播吧11月19日讯NBA常规赛，爵士以134133险胜太阳此役，爵士前锋马尔卡宁上阵35分钟18投15中，三分3中2罚球8中6，砍下38分6篮板3助攻1抢断。赛季至今，马尔卡宁场浙江省第十七届运动会开幕观众直呼难忘今宵一束光打在舞台，照亮了陈望道的柴房。董易鑫摄中新网金华11月19日电（记者董易鑫）全场暗下来，一束光打在舞台，照亮了陈望道的柴房这是真理的味道特别甜的故事，缘于浙江金华。18日晚，足协杯第二轮中冠球队挑落中超球队新华社北京11月18日电18日，2022中国足协杯第二轮结束，16支球队晋级第三轮。本轮爆出中冠球队淘汰中超球队的冷门。足协杯历史上从来不缺冷门，2014年足协杯就曾出现业余球队淘古德蒂发长文告别土耳其女排国家队11月18日晚，土耳其排协宣布与国家女排主教练古德蒂提前解约。在这之前，土耳其排协主席穆罕默德。阿基夫和古德蒂进行了会面，会谈之后做出了决定。古德蒂的合同本该到巴黎奥运会结束，之所电商与双11真的老了？又过双11，只是如今的双11与认知中的双11似乎发生了质变虽名字没变但内容却已沧海桑田虽总是看到各类捷报频传，但已然变为一头热的独角戏。这让我不由生出诸多疑问究竟双11是消费者的节