首页 / 开源热榜 / ds4 / 使用教程

ds4 中文教程:DwarfStar 硬件要求、构建与 llama.cpp 对比

更新于 2026-09-23 · NGJOO AI 实验室 · 约 9 分钟

DwarfStar(ds4) 是为少数大型开源权重模型定制的本地推理引擎。它使用 C、Metal、CUDA 和 ROCm,把模型加载、量化、KV 状态、HTTP 服务、coding agent、测试和基准放在同一仓库里。它不是通用 GGUF runner,只支持项目生产或指定的 GGUF。

旧页面已过期:ds4 当前不只支持 DeepSeek V4 Flash。官方 README 还列出 DeepSeek V4.1 Flash/PRO、GLM 5.2/5.3、GLM 5.3 Flash 和 Qwen3.8 Flash Next。不同后端的支持范围不同,应以 MODELS 文档为准。

1. 先判断硬件是否合适

平台官方定位构建入口
Apple Silicon主要目标为 96GB+ Mac;小内存可评估 SSD streamingmake
DGX SparkCUDA 重点目标make cuda-spark
一般 CUDA / 多卡含部分 Ada/L40S 多卡方案make cuda-generic
Strix HaloROCm,例:Framework Desktopmake strix-halo

模型文件、上下文和运行缓冲区都需要空间。下载前阅读 MODELS.md,不要只按权重文件大小估算。

2. 官方首次运行路径

git clone https://github.com/antirez/ds4.git
cd ds4

# 按上表选择一个构建目标;Apple Silicon 示例
make

# 96/128GB 机器的官方首次示例
./download_model.sh ds4f-q2
./ds4

下载会进入 gguf/,中断后可重跑继续。仓库变化很快,构建失败时先记录 commit、平台、内存、编译器和完整错误,再查对应平台文档。

3. CLI、Agent 和本地服务器

./ds4 -p "Explain Redis streams in one paragraph."
./ds4-agent
./ds4-server --ctx 32768

ds4-agent 直接运行本地推理并保存会话;兼容会话默认在 ~/.ds4/kvcache,可能包含私密对话和工具轨迹。ds4-server 默认监听 127.0.0.1:8000,提供常见的 OpenAI/Anthropic 风格接口。

服务安全:官方 SERVER 文档要求公网部署自行添加认证和 TLS。--cors 只增加跨域响应头,不会提供访问控制。第一次应保持 loopback 监听。

4. ds4 与 llama.cpp 的区别

维度ds4llama.cpp
模型范围少数模型,支持机会主义更新广泛模型与硬件生态
GGUF要求项目生成或指定的 GGUF通用 GGUF runner 生态
取舍针对指定模型和硬件做深度整合优先通用性、可移植性和广泛兼容

需要通用本地模型 runner 时先看 llama.cpp;硬件和模型正好落在 ds4 优化清单、愿意承担 beta 迭代时再选择 ds4。

5. 版本与验证边界

版本状态:截至 2026-09-23,官方 GitHub API 没有 release 或 tag;README 明确称项目快速变化、属于 beta。

验证状态:本次核对官方 README、MODELS、SERVER、CLIENTS、TESTING 和仓库元数据,没有下载权重、编译或运行。

没有验证:硬件兼容、权重哈希、token/s、SSD 寿命、量化质量、API 兼容与多机配置均需在目标环境实测。

这里仅补原教程没有展开的事实和边界。安装命令与操作步骤仍以前文为准。

先判断这个项目是否适合你

适合谁用

适合有 96GB+ Mac、DGX Spark、Strix Halo 或合适 CUDA 多卡的开发者研究本地大模型推理、长上下文、SSD streaming、多会话服务与 coding agent 接入。普通内存设备或需要多模型即插即用时不适合。

采用建议

适合具备高内存 Mac、DGX Spark、Strix Halo 或合适 CUDA 多卡,并愿意测试 beta 专用推理路径的用户。先确认模型、后端、内存和磁盘,再决定是否下载权重;需要通用本地模型 runner 时应优先评估 llama.cpp。

原教程未展开的系统信息

核心功能

  • SSD streaming 与持久化 KV 状态

    内存不足时可用 SSD streaming;原生 Agent 会把兼容会话存到 ~/.ds4/kvcache,保存内容可能含私密对话和轨迹。

架构与数据流

核心推理代码与 Metal/CUDA/ROCm 后端直接配合,模型、GGUF/量化工具、KV store、CLI、server、agent、评测和测试共同版本化。项目通过 platform-specific make target 选择后端;HTTP server 暴露 chat/completions、responses、completions 和 messages 接口。

常见问题

ds4 现在只支持 DeepSeek V4 Flash 吗?

不是。当前 README 还列出 DeepSeek V4.1 Flash/PRO、GLM 5.2/5.3、GLM 5.3 Flash 和 Qwen3.8 Flash Next;具体后端支持查 MODELS 文档。

普通 32GB 或 64GB Mac 适合运行 ds4 吗?

官方主要目标是 96GB+ Mac。小内存设备可能依赖 SSD streaming,但模型、上下文和速度限制明显。

ds4-server 可以直接暴露到公网吗?

不应直接暴露。官方要求公网部署自行增加认证和 TLS;CORS 不提供访问控制。

ds4 与 llama.cpp 怎么选?

要广泛模型和通用生态时选 llama.cpp;目标模型和硬件在 ds4 优化清单内,并能接受 beta 迭代时再评估 ds4。