LFM2.5-DSparkとは何か

LFM2.5-DSparkは、Liquid AIが開発した高速推論を実現するモデル最適化技術であり、従来のLFM2.5アーキテクチャを基盤としています。この技術は、3.2倍の高速化を達成し、オンデバイスでの実行を強化しています。特に、データ抽出やツール使用、構造化出力などのユースケースに最適化されています(出典: https://huggingface.co/blog/LiquidAI/lfm25-dspark)。

技術的詳細

LFM2.5-DSparkは、以下のモデルサイズとフォーマットをサポートしています:

  • 350Mパラメータ: LFM2.5-350MとLFM2.5-350M-GGUF
  • 1.2Bパララメータ: LFM2.5-1.2B-InstructとLFM2.5-1.2B-Instruct-GGUF
  • 2.6Bパララメータ: LFM2.5-2.6BとLFM2.5-2.6B-MLX
  • 8Bパララメータ: LFM2.5-8B-A1B

各モデルは、Quantized format(GGUF、ONNX、MLX)やONNX Runtimeを介したクロスプラットフォームデプロイメントを可能にしています(出典: 公式ドキュメントに記載なし)。

アーキテクチャと最適化

LFM2.5-DSparkは、拡張された前トレーニングと強化学習に基づくLFM2アーキテクチャを改良し、効率的な推論を実現しています。特に、MLXフレームワークを活用したApple Silicon向けの最適化により、Macデバイスでの高速実行が可能になっています。また、CPUオフロードハードウェアアクセラレーションをサポートするフレームワーク(vLLM、llama.cpp)も含まれています(出典: 公式ドキュメントに記載なし)。

推論フレームワーク

LFM2.5-DSparkは、以下のフレームワークで動作します:

  • Transformers: モデル内部への直接アクセスを可能に
  • vLLM: GPUを活用した高スループットなプロダクションデプロイ
  • llama.cpp: CPUオフロードをサポートするクロスプラットフォーム推論
  • MLX: Apple Silicon向けの最適化
  • LM Studio: ローカルでのLLM実行用デスクトップアプリ

特に、M5 Maxでのデコード速度220トークン/秒Ryzen AI Max+ 395での113トークン/秒という性能が記録されています(出典: https://huggingface.co/LiquidAI/LFM2.5-2.6B)。

何が可能か

LFM2.5-DSparkを活用することで、以下の実装が可能です:

  • データ抽出と構造化出力: ツール使用やRAG(Retrieval-Augmented Generation)に最適
  • ビジョン・言語タスク: LFM2.5-VL-450Mとの連携で、画像キャプション生成やオブジェクト検出を実現
  • オンデバイス推論: MLXやONNXを活用した低リソース環境での実行
  • マルチプラットフォームデプロイ: CPU、GPU、Apple Siliconでの柔軟な展開(出典: 公式ドキュメントに記載なし)。

まとめ

  • LFM2.5-DSparkの高速化技術を活用し、3.2倍の推論速度を実現できる
  • MLXやONNXを活用したApple Siliconやクロスプラットフォームでのデプロイが可能
  • データ抽出・ツール使用などのユースケースに最適化されたモデル構成
  • vLLMやllama.cppを介したGPUやCPUでの高効率推論が可能
  • ビジョン・言語モデル(LFM2.5-VL-450M)との連携でマルチモーダル処理を実現できる。