新闻
开yun体育网许多有后劲的优化决策-开云·kaiyun体育(中国)官方网站 登录入口

一家叫RapidFire AI的初创公司,发布了一个开源的大说话模子微调引擎,能让你的单个GPU同期并行跑上多个任务开yun体育网,把实验隐晦量径直干到了惊东谈主的20倍。
这事儿是谁干的?
RapidFire AI这家公司背后站着一位要道东谈主物,阿伦·库马尔(Arun Kumar),他是加州大学圣迭戈分校(UCSD)推测打算机科学与工程系的熏陶。库马尔熏陶在数据库系统、机器学习和大限制数据料理这些边界有很深的功力,而RapidFire AI引擎里最中枢的阿谁“超并行调理”和“动态截止”时间,表面基础就来自他的规划后果。
是以,这是正经八百的学术规划滚动。库马尔熏陶在公司里担任和谐创举东谈主和首席时间官(CTO)。
团队里还集中了来自亚马逊蚁集职业(AWS)、顶尖AI规划机构和科技巨头的工程师与科学家。
张开剩余88%气势挺豪华的。
RapidFire AI在本年拿到了一笔400万好意思元的pre-seed轮融资。领投的是.406 Ventures,一家专注于早期科技投资的知名风投;还有AI Fund,这个基金的和谐创举东谈主是大名鼎鼎的吴恩达;此外还有Osage University Partners,这家机构故意投资高校的科研后果滚动时势。
它到底解决了什么要命的问题?
念念让一个通用的LLM(比如LLaMA)在你的专科边界(比如金融、医疗)更好用,就得对它进行微调。微调就像是给一个通才大学生进行专科培训,让他成为大众。
你需要调养一大堆参数。比如,面前很火的低秩自符合(LoRA)时间,它的“秩”该设成几许?模子的量化决策何如选?给模子的指示,也等于教唆(prompt)结构何如联想?还有学习率这些超参数,以及强化学习里的奖励函数何如定?
这些成立项摆设组合起来,可能性多到无法念念象。
而GPU资源珍贵又有限,全球常常只可搞“串行实验”。什么赞佩呢?等于一次只跑一个成立,跑罢了,望望扫尾,再换下一个。这就像一条单车谈,整个车都得列队,效能奇低。许多有后劲的优化决策,可能因为排不上队,就长期被错过了。
还有一个痛点是,实验一朝跑起来,你就像个局外东谈主。眼睁睁看着某个成立的蚀本(loss)居高不下,昭着是个“差生”,却没办法坐窝叫停它。反过来,看到一个推崇优异的“勤学生”,念念坐窝复制它的奏凯熏陶,微调一下参数再多开几个雷同的实验,抱歉,也作念不到。你得等这轮跑完,手动操作,再再行列队。
这等于现时LLM微调边界的广博窘境:成立复杂、实验串行、资源哄骗率低,而况短缺动态调控的妙技。
RapidFire AI这个开源引擎,等于来系统性地解决这些问题的。
20倍隐晦量的玄妙兵器
RapidFire AI的中枢时间,不错抽象为:超并行执行、及时动态截止、自动GPU优化。
最中枢的更动,叫“超并行执行”。传统的微调是单车谈,RapidFire AI径直把它改形成了二十车谈的高速公路。它是何如作念到的呢?要道在于两个操作:数据分块和适配器热交换。
领先是把你的窥探数据切成一小块一小块的,叫数据块(chunk)。然后,你不错连气儿提交一大堆不同的微调成立,比如20个。引擎里的调理器(Scheduler)会十分智能地把这些不同的成立任务,分派到你的GPU上。
最妙的方位在于“适配器热交换”。在窥探经由中,当需要切换不同成立时(比如从LoRA秩为8的成立切换到秩为16的成立),系统不需要傻乎乎地把通盘高大的基础模子再行加载一遍。它只需要像换弹夹一样,快速换掉与这个成立联系的“适配器”(比如LoRA权重)。这个操作极地面减少了磁盘读写和时辰支拨,让GPU确凿不错无缝衔尾地处理下一个任务。
这么一来,你的单个GPU就能在脱色时辰里,同期“眷注”20个致使更多的实验成立。每个数据块窥探完成后,像蚀本、准确率这些要道意见,会坐窝流式传输到一个叫MLflow的容颜板上,让你及时掌合手整个实验的进展。
官方给出的数据走漏,在相似的硬件(比如一块英伟达A100 GPU)上,传统步伐一次只可跑1个成立,跑20个成立需要200个小时。而RapidFire AI不错同期跑20个,统共只需要10个小时。
实验隐晦量,进步了20倍。
RapidFire AI草创了一套叫“交互式截止操作”(Interactive Control Ops, IC Ops)的玩法。
通过阿谁MLflow容颜板,你就像个特等划策的将军,看着屏幕上整个成立(士兵)的及时战报(意见弧线)。
发现哪个成立推崇欠安,蚀本降不下去?径直一个“住手”(Stop)指示,坐窝断绝它,把珍贵的GPU资源开释出来给别东谈主用。
要是某个被你暂停的成立,你自后又以为它还有抢救的价值,不错给它一个“还原”(Resume)指示,它就能从前次停驻的方位不竭窥探。
看到某个成立推崇止境出色,是个好苗子?随即用“克隆修改”(Clone-Modify)功能,一键复制这个成立,然后稍稍蜕变一下参数(比如把学习率调高少量),一个新的、更有后劲的实验就坐窝加入了战役序列。
关于那些绝对失败概况无效的成立,一个“删除”(Delete)操作就能让实验环境还原整洁。
整个这些操作,都只需要在网页上点几下鼠标,不需要改代码,更不需要重启通盘实验。这种在实验半途“开天眼”并径直搅扰的智力,极地面进步了实验效能和资源哄骗率。
这背后是一套微职业架构在援救。你前端的操作指示,通过一个叫Dispatcher的接口,发给看成中央大脑的Controller,Controller再去指示具体的Worker程度执行。实验的整个状况都存在一个SQLite数据库里,保证了操作的快速反馈和状况的准确纪录。
你无用驰念何如把任务分派给GPU最合理,RapidFire AI内置的智能调理器会帮你解决一切。
要是你有一台多GPU的机器,比如4张卡。调理器会自动检测到,然后把任务分派下去。它不错让4张卡各跑一个寂寞的成立,也不错把一个止境大的模子拆分到多张卡上协同窥探,最大化哄骗你整个的推测打算资源。
它的调理计谋也很贤达,比如数据块级别的调理,保证GPU总有活干;适配器热交换,减少切换模子的恭候时辰;还有动态负载平衡,及时监控每张卡的负载,自动调养任务分派,幸免有的卡累死、有的卡闲死的情况。
从此,LLM微调就从一个“凭嗅觉、排长队、干瞋目”的慢活,变成了一个“看数据、皆步走、随时调”的兴隆。
硬核数据对比
传统微调在切换成立的时候,GPU有大批的适意时辰,哄骗率常常在40%到60%之间犹豫。而RapidFire AI通过高效的调理,能把GPU哄骗率结识在85%到95%的超高水平。成立切换的支拨,从几分钟镌汰到不及一分钟。
功能上的对比就更径直了。多成立并行、及时动态截止、适配器热交换这些中枢功能,传统器用基本都莫得。
它的兼容性也作念得很好,全面拥抱主流生态。原生援救PyTorch,无缝对接Hugging Face的常用库,比如Transformers、TRL(蜕变器强化学习)、PEFT(参数高效微调)。
吴恩达评价到:“许多竖立者正从教唆工程转向微调,以提高准确性、可靠性和资本效益。RapidFire AI赋予竖立者并走运转数十个实验的智力,加快构建高质料的调优模子。”
最紧要的少量,RapidFire AI选择了十分宽松的Apache 2.0契约将其开源。
参考贵府:
https://www.globenewswire.com/news-release/2025/09/23/3154671/0/en/RapidFire-AI-Launches-Breakthrough-Open-Source-Engine-for-LLM-Fine-Tuning-and-Post-Training.html
https://rapidfire.ai
https://aifund.ai/portfolio/rapidfireai
https://github.com/rapidfireai/rapidfireai
END开yun体育网
发布于:北京市