Skip to main content

5 posts tagged with "LLM"

Large language model related posts

View all tags

Ollama

· 11 min read

不是泛泛介绍 Ollama 是什么,而是专门测它的速度——在 Apple M1 Pro 上用 llama3.2:1b、qwen2.5:0.5b 跑出真实的 tokens/s 数据,同时梳理社区里"Ollama 比原生 llama.cpp 慢"的争议、和 vLLM/MLX 的对比,以及量化、上下文长度、GPU 开关这些影响速度的关键因素。