Googleが3種の新技術を発表 LLMのKVキャッシュとメモリ負担を大幅削減
Google Researchが、LLMの推論コストを左右するメモリ負担の削減に踏み込んだ。3月24日に発表した「TurboQuant」「PolarQuant」「QJL」は、KVキャッシュやベクトル検索を対象に、学習不要のまま圧縮と高速化を両立できるかが争点となると、Tom's Hardwareが報じた。
本ページでは「QJL」をテーマとした記事を一覧で掲載しています。
Google Researchが、LLMの推論コストを左右するメモリ負担の削減に踏み込んだ。3月24日に発表した「TurboQuant」「PolarQuant」「QJL」は、KVキャッシュやベクトル検索を対象に、学習不要のまま圧縮と高速化を両立できるかが争点となると、Tom's Hardwareが報じた。