Artificial Intelligence KVキャッシュ
Artificial Intelligence
Artificial Intelligence llm-jp-4-33b-thinkingに触れてみる
llm-jp-4というモデルを再び取り上げる以前、llm-jp-4のアーキテクチャ という記事や アーキテクチャの違いで何が変わるのか? などで紹介したこともあって、これからちゃんと調べよと思いますなどと言いながら、気づいたら結構長い時間が...
Artificial Intelligence Qwen3.8-27Bに触れた
待望のSLMとなるか?Qwen3.8のコンパクトモデル登場!まさかの2026年8月15日、終戦記念日の午前0時にリリースされました、Qwen3.8-27Bでございます。これより前に登場したQwen3.8-Maxに相当するんじゃないかと言われ...
Artificial Intelligence RTX3060とGemma-4-12b
GeForce RTX 3060は意外にやる子過日、まさかの3万YEN切る価格で入手したRTX 3060ですが、実は以前会社員時代に最初に会社で購入したGPUでもあります。2022年当時の相場だとおよそ80,000JPYでしたね。このころは...
Artificial Intelligence Dify/llama.cppの利用は盲目的にはできない件
llama.cppの心得:同時接続数に気を付けようEmbeddingモデルを使う際、私はローカルSLMをよく利用します。理由は「レイテンシーが低いから」の1点に尽きます。API型LLMで実行する場合に比べて恐ろしく処理が速くなるんですね。ま...
Artificial Intelligence アーキテクチャの違いで何が変わるのか?
アーキテクチャの違いで言語モデルの動きに差が出るのか?というところがなかなかピンとこないことがあります。特にDeepLearningモデルの領域では、ことあるごとに新しい仕組みが生まれては世代が変わり、それが学習の差によって出るものなのか、...
Artificial Intelligence llama.cppにおけるKVキャッシュ量子化について
KVキャッシュ量子化を軽々しく使うとつらい目に遭ったというタイトルで始めたんですけど、気づきは本当に偶然です。GPUSOROBANのインスタンスでllama.cppとLiteLLM連携の検証をしたときに気づいた話です。KVキャッシュというも...
Artificial Intelligence KVキャッシュとは
先の投稿でKVキャッシュの容量について話題を出したので、これを掘り下げて解説することにしました。トランスフォーマー型LLM/SLMにおける基本的な動き基本的にこの手のLLM/SLMはこんな動きをしてる。AIモデルは、特にBi-Directi...
