KVキャッシュ

Artificial Intelligence

皆さんお待ちかね!? Qwen3.8-27Bの実力を見てみる。

Artificial Intelligence

Qwen3.8-27Bに触れた

待望のSLMとなるか?Qwen3.8のコンパクトモデル登場!まさかの2026年8月15日、終戦記念日の午前0時にリリースされました、Qwen3.8-27Bでございます。これより前に登場したQwen3.8-Maxに相当するんじゃないかと言われ...
Artificial Intelligence

RTX3060とGemma-4-12b

GeForce RTX 3060は意外にやる子過日、まさかの3万YEN切る価格で入手したRTX 3060ですが、実は以前会社員時代に最初に会社で購入したGPUでもあります。2022年当時の相場だとおよそ80,000JPYでしたね。このころは...
Artificial Intelligence

Dify/llama.cppの利用は盲目的にはできない件

llama.cppの心得:同時接続数に気を付けようEmbeddingモデルを使う際、私はローカルSLMをよく利用します。理由は「レイテンシーが低いから」の1点に尽きます。API型LLMで実行する場合に比べて恐ろしく処理が速くなるんですね。ま...
Artificial Intelligence

llama.cppにおけるKVキャッシュ量子化について

KVキャッシュ量子化を軽々しく使うとつらい目に遭ったというタイトルで始めたんですけど、気づきは本当に偶然です。GPUSOROBANのインスタンスでllama.cppとLiteLLM連携の検証をしたときに気づいた話です。KVキャッシュというも...
Artificial Intelligence

KVキャッシュとは

先の投稿でKVキャッシュの容量について話題を出したので、これを掘り下げて解説することにしました。トランスフォーマー型LLM/SLMにおける基本的な動き基本的にこの手のLLM/SLMはこんな動きをしてる。AIモデルは、特にBi-Directi...