FlashAttention

ハードウェア

Ollama v0.31.2 完全版:CUDA 6.x 復活で旧GPU推論が劇的に向上!

Ollama v0.31.2 がリリース!CUDA 6.x と FlashAttention の復活により、旧世代 GPU でも最新の LLM 推論性能が劇的に向上。VRAM 制限に悩む方へ、今すぐチェックすべきアップデートの詳細と設定方法を解説します。
ローカルLLM

llama.cpp b9437:ベンチマーク自動化と-ngl変更徹底解説

llama.cpp b9437の最新アップデートを徹底解説。ベンチマーク自動化機能と-nglデフォルト値変更の意義、ローカルLLM開発者への影響を詳しく分析。OllamaやLM Studioなど上位ツールへの波及効果も確認。詳細は記事をご覧ください。
AI研究

llama.cpp b9301 速報!Snapdragon PC向けFlashAttention進化

llama.cpp b9301 が公開され、Snapdragon X 搭載 PC の推論性能が劇的に向上します。Hexagon 最適化と FlashAttention の repl 改良により、NPU/DSP を活用した高速化を実現。ローカルLLM推論の最新動向とメリットを詳しく解説します。