AI 推論優化方案 | 2026-08-21
近期熱門
1. unsloth/unsloth (74K⭐ +3,338/週) — 本地 LLM 訓練與推論 UI,支援 Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、DeepSeek-V4、FLUX 等模型,提供高效的 LoRA/QLoRA 微調與推理管道。
2. cactus-compute/needle (8K⭐ +3,838/週) — 僅 14MB 的微型基礎模型,專為手機、穿戴裝置、智慧家居和機器人等小型設備設計,代表端側推論的最新進展。
3. jundot/omlx (20K⭐ +1,102/週) — 專為 Apple Silicon 設計的 LLM 推論伺服器,支援連續批次處理(continuous batching)與 SSD 快取,可從 macOS 選單列管理。
4. MakazhanAlpamys/Soup (2.5K⭐ +1,802/週) — 單一 YAML 檔案即可微調 LLM,層流式訓練(layer streaming)技術讓 8B 模型可在 4GB 筆電 GPU 上訓練。
5. volcengine/OpenViking (31K⭐ +1,659/週) — 自我進化的 Context Database,統一 Agent 記憶、知識 RAG 與技能管理,為 AI Agent 推論提供基礎設施。
6. Qwen3.8-PrismaAQUA 量化系列 — rdtand 推出的 PrismaAQUA 5.5bit 量化模型,支援 vLLM 部署,27B 參數模型僅需 13GB 記憶體即可推論。
7. PrismaQuant DeepSeek-V4-Flash 量化 — DeepSeek-V4-Flash 85B 模型經 PrismaQuant 量化,支援 gridbook 分塊策略,需 87GB 記憶體。
8. Laguna-S-2.1 ModelOpt NVFP4 — 61B 模型採用 NVIDIA ModelOpt NVFP4 格式,W4A4 量化搭配 KV 快取最佳化,支援 vLLM 部署。
9. NVIDIA Nemotron-3 Q3_K_M 量化 — 120B 超大模型經 Q3_K_M 量化後反量化為 BF16 推論,透過 vLLM 部署。
10. kernels-community/quantization-bitsandbytes — Bitsandbytes 量化後端的高效能 kernel 實現,支援 INT8/FP8 量化。
建議關注:對 qwen3 系列有實際加速效果的方案
1. PrismaAQUA 5.5bit 量化 + vLLM — rdtand/Qwen3.8-27B-PrismaAQUA-5.5bit-vllm:將 27B 模型量化至 5.5bit,推論記憶體從 ~54GB 降至 ~13GB(5080 環境),在 vLLM 下可正常部署。同系列還有 PrismaSCOUT Blackwell NVFP4-BF16 版本(17B 參數),利用 NVIDIA 新一代量化格式達成更高效的推論。
2. PrismaQuant + DS-Park 分塊策略 — rdtand/DeepSeek-V4-Flash-0731-PrismaQuant-AQUA-gridbook:針對 DeepSeek 架構的 MoE 模型採用 gridbook 分塊量化,87GB 可容納 85B 模型,適合有 80GB+ GPU 的部署環境。
3. Unsloth 微調管道 — unslothai/unsloth:支援 Qwen3 系列的高效 LoRA/QLoRA 微調,可直接在本地環境微調後部署至 vLLM/TGI 等推論伺服器。
4. NVFP4 + W4A4 量化 — JasonW2025/Laguna-S-2.1-ModelOpt:NVIDIA 的 NVFP4 格式搭配 W4A4(權重/激活皆 4-bit)量化,並針對 KV 快取做最佳化,對 Qwen3 系列推論延遲有顯著改善。
5. MLX-LM 端側推論 — ml-explore/mlx-lm:Apple Silicon 原生 LLM 推論框架,對 Qwen3 系列有良好支援,適合 Mac 用戶做本地推論。
6. GGUF 量化格式 — HF 上 Qwen3-30B-A3B 等模型已有 GGUF 量化版本(3bit/4bit),可透過 llama.cpp 在 CPU 上執行推論。