LFM2.5-DSparkとは何か
LFM2.5-DSparkは、Liquid AIが開発した高速推論を実現するモデル最適化技術であり、従来のLFM2.5アーキテクチャを基盤としています。この技術は、3.2倍の高速化を達成し、オンデバイスでの実行を強化しています。特に、データ抽出やツール使用、構造化出力などのユースケースに最適化されています(出典: https://huggingface.co/blog/LiquidAI/lfm25-dspark)。
技術的詳細
LFM2.5-DSparkは、以下のモデルサイズとフォーマットをサポートしています:
- 350Mパラメータ: LFM2.5-350MとLFM2.5-350M-GGUF
- 1.2Bパララメータ: LFM2.5-1.2B-InstructとLFM2.5-1.2B-Instruct-GGUF
- 2.6Bパララメータ: LFM2.5-2.6BとLFM2.5-2.6B-MLX
- 8Bパララメータ: LFM2.5-8B-A1B
各モデルは、Quantized format(GGUF、ONNX、MLX)やONNX Runtimeを介したクロスプラットフォームデプロイメントを可能にしています(出典: 公式ドキュメントに記載なし)。
アーキテクチャと最適化
LFM2.5-DSparkは、拡張された前トレーニングと強化学習に基づくLFM2アーキテクチャを改良し、効率的な推論を実現しています。特に、MLXフレームワークを活用したApple Silicon向けの最適化により、Macデバイスでの高速実行が可能になっています。また、CPUオフロードやハードウェアアクセラレーションをサポートするフレームワーク(vLLM、llama.cpp)も含まれています(出典: 公式ドキュメントに記載なし)。
推論フレームワーク
LFM2.5-DSparkは、以下のフレームワークで動作します:
- Transformers: モデル内部への直接アクセスを可能に
- vLLM: GPUを活用した高スループットなプロダクションデプロイ
- llama.cpp: CPUオフロードをサポートするクロスプラットフォーム推論
- MLX: Apple Silicon向けの最適化
- LM Studio: ローカルでのLLM実行用デスクトップアプリ
特に、M5 Maxでのデコード速度220トークン/秒、Ryzen AI Max+ 395での113トークン/秒という性能が記録されています(出典: https://huggingface.co/LiquidAI/LFM2.5-2.6B)。
何が可能か
LFM2.5-DSparkを活用することで、以下の実装が可能です:
- データ抽出と構造化出力: ツール使用やRAG(Retrieval-Augmented Generation)に最適
- ビジョン・言語タスク: LFM2.5-VL-450Mとの連携で、画像キャプション生成やオブジェクト検出を実現
- オンデバイス推論: MLXやONNXを活用した低リソース環境での実行
- マルチプラットフォームデプロイ: CPU、GPU、Apple Siliconでの柔軟な展開(出典: 公式ドキュメントに記載なし)。
まとめ
- LFM2.5-DSparkの高速化技術を活用し、3.2倍の推論速度を実現できる
- MLXやONNXを活用したApple Siliconやクロスプラットフォームでのデプロイが可能
- データ抽出・ツール使用などのユースケースに最適化されたモデル構成
- vLLMやllama.cppを介したGPUやCPUでの高効率推論が可能
- ビジョン・言語モデル(LFM2.5-VL-450M)との連携でマルチモーダル処理を実現できる。