PrismML Bonsai — 1.15GB的8B模型,真的可行吗?
由Caltech团队打造的PrismML Bonsai是一款1-bit LLM,仅用{-1, +1}两个值表示权重。 8B模型压缩至1.15GB,据称推理速度是全精度的8倍。本文做了实际验证。
标签
11篇文章
由Caltech团队打造的PrismML Bonsai是一款1-bit LLM,仅用{-1, +1}两个值表示权重。 8B模型压缩至1.15GB,据称推理速度是全精度的8倍。本文做了实际验证。
Google以Apache 2.0开源了Gemma 4,我用Ollama亲自安装并测试了中文、结构化输出和函数调用。 一个9.6GB的本地模型,能成为Agent流水线的构建模块吗?
ggml.ai团队加入Hugging Face,确保llama.cpp的长期可持续发展。本文分析本地AI推理生态系统的结构性变化及技术意义。
ik_llama.cpp开发的IQ系量化方法正式合并至llama.cpp主线。详解IQ2_K至IQ4_KS的精度提升与本地LLM推理效率优化的技术背景。
ggerganov重构llama.cpp计算图,使Qwen3 Coder Next 80B模型推理速度提升最高38%。详细解析优化技术与基准测试结果。
DDR5 RDIMM的每GB价格已低于RTX 3090的VRAM,标志着本地LLM硬件选择的转折点。本文分析CPU推理与GPU推理的成本结构。
Mistral Devstral Small 2 24B和Qwen3 Coder 30B同时登场。可在Raspberry Pi上运行的小型编码模型对比分析及本地AI编码的未来展望。
深入分析14M参数、不到25MB即可实现云端TTS品质的Kitten TTS V0.8。探讨边缘设备部署的可能性及本地语音AI最新趋势。
Heretic 1.2正式发布。通过4bit量化将VRAM使用量最多降低70%,MPOA技术实现高质量消融。详解本地LLM运营成本削减的最新方法。
分析在8GB VRAM消费级GPU上运行80B参数编码AI模型的量化和懒加载技术。探讨本地LLM编码的实用性与局限性。
NVIDIA DGX Spark的sm121架构引发大量CUDA软件不兼容。详细分析Triton框架失效、FP4/FP6量化不可用、HDMI故障等实际缺陷以及掌机芯片挪用嫌疑,并提供消费者购买AI工作站前需核实的判断清单与避坑建议。