专栏电商日志财经减肥爱情
投稿投诉
爱情常识
搭配分娩
减肥两性
孕期塑形
财经教案
论文美文
日志体育
养生学堂
电商科学
头戴业界
专栏星座
用品音乐

想自建一个ChatGPT而不是ChatPPT,要从哪开始做?

  作者:小傅哥
  博客:https:bugstack。cn
  沉淀、分享、成长,让自己和他人都能有所收获!
  最近ChatGPT很火,火到了各行各业。记得去年更多的还是码农最新体验后拿它搜代码,现在各行各业都进来体验,问它咋理财、怎么写报告和给小孩起名。也因此让小傅哥在头条的一篇关于ChatGPT的文章都有了26万的阅读。把ChatGPT配置到微信群里,可以对AI提问了!
  除了大家都想体验一下这款智能的ChatGPTAI,也有很多互联网公司开始搭建自己的ChatGPT,但真的挺担心最后整出来的不是ChatGPT而是ChatPPT。为此我也想研究下ChatGPT是怎么做出来的,都说是模型和数据训练,那我能训练吗?这东西离我想做个demo出来有多远?一、技术调研,很激动
  当我开始往算法模型训练里踏进一脚,漏个门缝检索点相关学习资料和案例代码,发现这个世界太庞大了。早在4年前,GPT2就已经发布了openai开源代码https:github。comopenaigpt2也就是说我们就可以拿GPT2的开源代码训练一个模型,哪怕是训练出个傻子,也应该比xxx,我在,你说。要更智能一些。
  接着检索我发现了,早在2年前有人已经基于GPT2训练一版GPT2forChinesechitchat用于中文闲聊的GPT2模型。开源代码:https:github。comyangjianxin1GPT2chitchat
  不知道在做的兄弟们你们激动不,看到这我是挺开心。这不是我想要的demo模型吗。把它给训练出来,也就能满足我对ChatGPT的深入了解了,并且基于我想做的任何类数据训练得到一个个小模型部署,也是可以帮助我来完成一些事情的。如;你把公司的一些文档数据进行训练,得到一份可以搜索检索就能获取相关数据的ChatGPT不挺爽吗?
  越是检索越是开心,离我的目标也越来越近了。但作为一个量化算法训练的小白,其实我还是希望能找到一份Java的模型训练代码,这可以让我操作起来更加顺畅。没错,我找到了,也是3年前就有的一份资料;https:github。comSimiaCryptustfgpt2这是一个基于Tensorflow的GPT2文本模型的Java库。别着急,这个时候我也不知道Tensorflow是啥。
  这还说啥,这有pom配置,还有代码案例。引入一下就能跑,上车吧!
  好家伙,跑起代码才知道。这货上来就下了1个多G的pb模型数据,之后有报错MacM1兼容性问题。折腾一大堆,最后又报错;YourCPUsupportsinstructionsthatthisTensorFlowbinarywasnotcompiledtouse:SSE4。2AVXAVX2FMA要是你咋整,你再坚持坚持,还是放弃!二、风浪越大,鱼越贵
  本来以为ChatGPT嘛、Python嘛、跑个数据模型吗!这能几道墙阻挡我的去路,不就是换个工具写代码吗?但当我逐步进入后发现,这距离好像比想象的大的多!
  想玩ChatGpt玩到模型训练,得先进入Gpt2开源代码。基于想自己训练一个小模型,需要使用TensorFlow创建生产级机器学习模型。而TensorFlow需要在本地安装一系列Python工具并下载模型和数据样本。而这里就像安装JDK一样,是傻子都会和傻子都不会。MacM1天生骄傲,安装了2天,才测试出可以使用的模型训练环境。之后开始跑第一个模型,线性回归。再了解什么是线性回归。
  这是TensorFlow的官网,用于创建生产级机器学习模型。也就是说想要完成一个简单的ChatGPT得从这开始。死鬼,不要在想了,你总是得从HelloWorld开始。
  但在检索的过程中,我又找到了一个名叫huggingface。co的网站;Huggingface起初是一家总部位于纽约的聊天机器人初创服务商,他们本来打算创业做聊天机器人,然后在Github上开源了一个Transformers库。虽然聊天机器人业务没搞起来,但是他们的这个库在机器学习社区迅速大火起来。目前已经共享了超100,000个预训练模型,10,000个数据集,变成了机器学习界的Github。
  在Huggingface社区中可以找到相关的模型训练资源以及提供好的模型使用接口,比如像中文分词、聊天对话、图片分析也都有,当然也包括一些公司训练出来的gpt2模型。
  在Models中提供了大量的算法模型,你可以把自己需要的模型点个like关注起来。同时这些模型还提供好了调用接口,例如【apikey可以在网站申请】;curlhttps:apiinference。huggingface。comodelsmicrosoftCodeGPTsmalljavaXPOSTd{inputs:Canyoupleaseletusknowmoredetailsaboutyour}HAuthorization:BearerhfcYfJAwnBfGcKRKxGwyGItlQlRSFYCLphgG
  你可以通过接口对模型进行访问,当然这些模型训练的数据并不是很大,只是作为测试使用。不会像ChatGPT那么智能的返回你所检索的信息。不过这至少可以让你了解和体验不同模型所带来的数据返回是什么样。三、环境配置,搞起来
  一口不能呲个胖子,为了更好的为以后能训练出一个自己可以玩的小体量的ChatGPT模型,总得要从头开始。
  这里小傅哥的目标是带着搭建先在本地搭建起一个TensorFlow的基础环境,来跑个Python的简单算法模型。为此我们需要进行一下环境配置。小傅哥2台机器已验证没问题,分别是MacIntelM1,机器配置4核16G。1。Python环境下载Python:https:www。python。orgdownloadsmacos3。6版本以上。一般Mac上会带一个2。x版本的Python,这个版本不够用,需要升级下。配置Python:安装Python完成后,搜索地址whichpython3打开vi。bashprofile文件,写入环境配置aliaspythonLibraryFrameworksPython。frameworkVersions3。10binpython3生效配置source。bashprofile2。pip指令安装安装pip:以下需要用到pip指令,如果没有需要安装curlhttps:bootstrap。pypa。iogetpip。pypython33。Tensorflow
  官网安装指导:https:www。tensorflow。orginstall?hlzhcn
  但这里有个问题,没有说明MacM1怎么安装。如果按照这个代码在M1的机器是安装不上的。所以在小傅哥的一顿折腾后找到了对应的按照指令。步骤如下;下载代码【可选】:https:github。comfuzhengweiTensorFlowTutorial用于后续测试模型训练代码配置VisualStudio【你也可以是其他的】,打开以后需要安装python插件以及配置登录github,这样会更利于后续的操作。之后在VisualStudio的终端下,查看下pythonV的版本,如果不是最新安装的3。x版本,可以刷新下配置source。bashprofile。Mac电脑安装Tensorflow:python3mpipinstalltensorflowmacos安装比较耗时,需要等待。如果失败了就继续执行这条指令。
  安装后测试:python3cimporttensorflowastf;print(tf。reducesum(tf。random。normal(〔1000,1000〕)))只要能输出结果为即可。四、跑个模型,验证下
  可能很多伙伴不知道什么是算法模型,简单描述比如;为啥给你推荐你喜欢看的美女,为啥给你发送一个键盘购物券、为啥看你小子有钱就总给你推荐豪车。这都是根据你身上的标签进行模型训练的结果,在众多的人群中找到目标用户。另外像我在腾讯做量化算法的小伙伴说,决策树就是一种简单的算法模型。
  代码详见:https:github。comfuzhengweiTensorFlowTutorial
  测试结果fuzhengweiMacBookProTensorFlowTutorialusrlocalbinpython3Usersfuzhengwei1024githubTensorFlowTutorialcodeslinearregression。pyEpoch150011〔〕0s3mssteploss:0。0150Epoch50050011〔〕0s2mssteploss:0。015011〔〕0s76msstep〔〔0。19686729〕〕11〔〕0s29msstep〔〔1。0953956〕〕11〔〕0s29msstep〔〔1。9939239〕〕11〔〕0s31msstep〔〔2。8924522〕〕11〔〕0s30msstep〔〔3。7909803〕〕11〔〕0s30msstep〔〔8。283622〕〕
  这是一个训练了500次的线性回归预测模型;线性回归可以预测房价、预测股票、预测天气和评估经济。
  这一篇文章先给我自己以及大家对ChatGPT开个门,让对此感兴趣的编程爱好者可以参与进去学习。在我感觉ChatGPT的出现会打破某些平衡,对一些事项进行秩序重置。因此也让更多的人获得了大量的机会。

叙利亚的苦难历程下阿拉伯人中流传着这样一句谚语,如果上帝爱谁,就让他出生在大马士革。大马士革是叙利亚的首都,它是一座世界有人居住的最古老城市之一,有人间花园地上天堂之美称。然而,自2011年3月16近代资产阶级旧民主主义革命为什么没有出路?中国近代资本主义发展先天不足。思想上准备不足,受中国古代的重农抑商重陆轻海重义轻利等思想观念影响资金准备不足,要知道近代中国的国门是被动打开的。资本主义的发展的主要推力并不是来自中亲身经历,打假拼多多阿里京东公司品牌在各个平台都存在假货,都是亲身经历的打假历程。先说拼多多,提交知识产权证书,然后每天去拼多多知识产权后台查看进程,一直是在审核,看了大概半个月,放弃了,再也没去看了。然后过现在的孩子为什么活的累,主要原因是无法接受孩子和自己的平凡!头条创作挑战赛幸福的童年治愈一生。不幸的童年需要一生来治愈。最近火爆网络的是一个姑娘说下辈子再也不来了!引起了很多人的共鸣!为什么我们活的如此艰难,没有幸福感?我最近特怕回家,不是古代犯人逃跑刑捕如何抓获,会有什么惩罚?浅谈罪人拒捕律令阅读此文前,诚邀您点击一下关注,既方便您进行讨论与分享,又给您带来不一样的参与感,感谢您的支持。引言现如今,许多人都听过肇事逃逸,尤其是在交通方面更是耳闻能详。探究历史,我国古代也熊孩子沉溺网游,充值花掉上万治病钱手机游戏是不少人们消遣娱乐的重要方式,为了获得更好的游戏体验,很多玩家选择充值购买游戏装备,来达到更好的体验。近日,一名熊孩子使用家长的银行卡给游戏充值,家长对此毫不知情,直到去医外网热议为什么中国人在乒乓球上如此霸道?印度网友基因原因在美国问答网站上看到这样一个问题为什么中国人在乒乓球上如此霸道?不得不说霸道这个词用的真的太贴切了,中国乒乓球队的实力实在是太强了,只能用顶级来形容。全世界一共有10位大满贯得主,为何中国足球水平不升反降?近年来,中国足球尤其是男足国字号球队长期在低位徘徊,职业联赛呈现诸多乱象,足球市场萎靡难振。与此同时,国内青少年足球人口依然严重不足,社会足球发展难见突破。出现这些问题的症结究竟在武宣半马即将盛大开跑3月22日,2023奔跑吧广西生态马拉松系列赛暨武宣大藤峡生态半程马拉松(以下简称2023武宣半马)新闻发布会在国家体育总局北京体育馆一层举行,揭晓了赛事最新动态。新闻发布会现场中NikeAirMax97Snakeskin新色登場NikeAirMax97在今年迎來二十周紀念,除了經典的原版配色回歸,品牌也釋出不少全新樣式一同來慶祝這雙鞋履的二十歲生日。充滿流線感的外型是設計師ChristianTresser近4轮3败!穆里尼奥执教罗马联赛均分降至1。69,跌出队史前十直播吧3月22日讯最近4轮意甲比赛遭遇三场败仗,积分榜上球队落后第四的AC米兰1分,暂列第五位。对穆里尼奥来说,这几场失利使得他执教罗马的联赛场均得分掉至1。69分,根据米兰体育报
比特币就是一个骗局,为什么还这么多人相信?谢谢邀请!谁定义比特币是个骗局?请站出来解释一下,以正视听。比特币诞生己10年了,参与比特币交易的人也越来越多。没有哪个骗局能骗10年之久。尽管世界上大多数国家央行不承认比特币的货纯电动车一定比燃油车好吗?驾驶品质动力感受两方面为电动汽车整体领先电动汽车究竟有什么魅力,能够在短短十年内面对燃油车阵营的围追堵截,成功改变了流行风向成为新的热销车?类似的问题不胜枚举。尤其在2021年很多读小学的儿子,因为家庭作业没有完成背诵,被留下来批评,家长也被教育了,你怎么看?老师批评学生没有完成家庭作业的背诵,还一同把家长给教育了。这看似以小事当大事的作法,却反映了老师认真负责的工作作风,值得大家点赞!如果老师不这样严要求,放过一次学生不管,学生则以为全运会版的男篮辽粤争霸谁会笑到最后?广东不可战胜全运会男篮比赛改了规则,貌似辽宁占尽便宜,可以弥补适龄球员差距,但还不行上届全运会易建联压阵,广东队都输给了新疆队,在于他们的适龄球员太差,当时只能两个超龄球员打球,今如果当初国足主教练选的是李霄鹏,会不会优于目前的李铁?感觉会好一些,因为李霄鹏踢球和执教都是比较灵活的!图1大头最适合了?他踢足球的时候用脑,同样当教练也会有多样化的战术策略和战术体系去带领球队。思路决定出路,肯定会是不一样的过程。当联想到底怎么了?16512G突然调低1300,还要支持联想吗?支持个屁,算吗?支持他挣钱去美军白送?支持他918画日本武士旗打折?支持他滴滴高层有美国军方背景人员?支持他小额贷款吸血国人?司马南老师基于上市财报七问联想,联想至今还未正面回应。西安买房子能买小产权房吗?自己住的刚需就没什么问题,但是要查好,最好是正规的城中村改造项目,后期通过补缴土地出让金是可以买卖的,但是同时也有些问题你必须知道,这种房子基本没有什么物业服务,所以卫生不会很好,退休后的档案自己可以保管吗?退休后的档案自己可以保管吗?个人人事档案,不管是在退休前还是在退休后都是不能自己保管的,人事档案一般都是属于机要文件,应按照机要件进行管理。像你说的这种情况,很多灵活就业人员在办完堂姐开100万的奔驰,存款过千万,向她借6万,说没钱,为啥?我的父母开了一个大型超市,每年的净利润大约100多万,存款差不多900多万,父亲买了150多万的路虎揽胜,一家人的日子过的真的是其乐融融,但是我的亲戚却成为了一个毒瘤,天天找我爸妈雪里蕻是什么?这个问题我一定要答!雪里蕻是我在老家时非常喜爱的吃的一种蔬菜,它属于芥菜的变种,又叫雪里红!小时候我妈总是腌制然后加黄豆炒给我吃,加点辣椒碎,喝粥的时候我能喝好几碗!再说雪里蕻之前北京出发,自驾去额济纳旗胡杨林,6天来回,有什么好玩的推荐?北京自驾去额济纳旗胡杨林,单程1500多公里,6天时间来回的话,时间太紧了。但你如果是自驾铁人,或者是自驾超级控,也是可以实现的。来回路途4天,在额济纳用两天时间可以游玩胡杨林黑城
友情链接:快好找快生活快百科快传网中准网文好找聚热点快软网