微软研究团队提出 LLM 加速器 LLMA,可无损加速大型语言模型与引用的推理
据 MarketPost 报道,微软的一组研究人员提出 LLM 加速器 LLMA。据悉。这种带有参考文献的推理解码技术可以在许多现实世界的环境中,通过利用 LLM 的输出和参考文献之间的重叠来加快 LLM 的推理速度。LLMA 的运作方式是从参考文献中选择一个文本跨度,将其标记复制到 LLM 解码器中,然后根据输出的标记概率进行有效的并行检查。
本文链接:https://www.8btc.com/article/6814410
转载请注明文章出处
原创文章,作者:惊蛰财经,如若转载,请注明出处:http://www.xmlm.net/bhq/23599.html