Ollama
不是泛泛介绍 Ollama 是什么,而是专门测它的速度——在 Apple M1 Pro 上用 llama3.2:1b、qwen2.5:0.5b 跑出真实的 tokens/s 数据,同时梳理社区里"Ollama 比原生 llama.cpp 慢"的争议、和 vLLM/MLX 的对比,以及量化、上下文长度、GPU 开关这些影响速度的关键因素。
Large language model related posts
查看所有标签不是泛泛介绍 Ollama 是什么,而是专门测它的速度——在 Apple M1 Pro 上用 llama3.2:1b、qwen2.5:0.5b 跑出真实的 tokens/s 数据,同时梳理社区里"Ollama 比原生 llama.cpp 慢"的争议、和 vLLM/MLX 的对比,以及量化、上下文长度、GPU 开关这些影响速度的关键因素。
Blume 是一个基于 Astro 和 Vite 的开源文档框架,维护一个 Markdown 文件夹就能生成带本地搜索、AI-ready 输出和组件库的静态文档站,不用自己搭一个 React 项目。
DSH Desktop 是社区做的 DeepSeek Harness 原生桌面客户端,把官方 Web UI、Host 服务和插件系统打包进一个下载即用的桌面应用,不隶属深度求索官方。
Kimi CLI 是 Moonshot AI 做的终端 AI 编程 Agent,能读写代码、执行 Shell 命令并接入 MCP、ACP 编辑器协议,项目目前已被官方标注为逐步停止维护,建议新用户直接使用继任项目 Kimi Code CLI。
wigolo 是一个本地优先的 MCP server,把网页搜索、抓取、爬取、结构化提取等六个核心工具做成完全不需要 API Key 的本地引擎,这篇记录实际装好后逐个测试这六个工具的过程。