performance

Artificial Intelligence

Qwen3.8-27Bに触れた

待望のSLMとなるか?Qwen3.8のコンパクトモデル登場!まさかの2026年8月15日、終戦記念日の午前0時にリリースされました、Qwen3.8-27Bでございます。これより前に登場したQwen3.8-Maxに相当するんじゃないかと言われ...
Artificial Intelligence

Gemma-4-12b-it Audio Transcriptを試す

Llama.cpp付属のWeb-UIで実現可能Gemma-4-12b-itでは、それまで外付けエンコーダーを必要としていたものがモデルの中に組み込まれ、特に意識することなくオーディオ書き取りが行えます。私がオーディオ書き取りの機能をモデルを...
Artificial Intelligence

勉強会なるものに行ってきたよ!

オフサイトで勉強会に行くのは何年ぶりだろうかこれに行ってきましたです。開発者視点のローカルLLMはどう見えてるのか?と言うのが気になりました。福岡でも有名なエンジニアさんであるきしだ(@kis)さんが主宰されており、会場は博多駅から近いLI...
Artificial Intelligence

論文翻訳品質確認をしてみたよ。

Hy-MT2-1.8Bの実力を測ってみたTencentが公開した中で、軽量モデルであるHy-MT2-1.8Bについて評価をしてみました。Tencentは中国企業の中でもかなり初期段階からDeepLearningの画像系処理でもろもろ取り組ん...
Artificial Intelligence

llama.cppにおけるKVキャッシュ量子化について

KVキャッシュ量子化を軽々しく使うとつらい目に遭ったというタイトルで始めたんですけど、気づきは本当に偶然です。GPUSOROBANのインスタンスでllama.cppとLiteLLM連携の検証をしたときに気づいた話です。KVキャッシュというも...
Artificial Intelligence

メモリの帯域は馬鹿にならない

ローカルLLMを動かすときの重要なカギ:メモリ帯域ローカルLLMやSLMを使用するとき、皆さんはどういうグラフィックボードを使用されるのでしょう?大体は安価な製品なちょい古めの・・そう、例えばRTX3060-12GBみたいなものを使って動か...
Artificial Intelligence

Gemma4-E2Bの動きを再度見る(CPU編)

以前「Gemma-4がでた」という記事を書いたんですが、この時VMに対して割り当てるCPU数を2に制約してたので、今回このCPU数を3に増やしてちょっと実行してみました。再推論したらこの通り、300%近傍まで負荷を上昇させることができました...