引子:把云端 Credits 烧光之后
上周翻自己的 Perplexity 月账单,发现一个尴尬的事实:用 Computer 模式做”读 PDF → 整理字段 → 写 Markdown”的常规任务,单次任务能消耗 1.5~4 Credits。一个月下来,几百块订阅不够烧——尤其是当 Agent 要跑几轮子任务时。
8 月 25 日,Perplexity 联合 NVIDIA 推出 Portable Computer,一句话承诺:「本地任务不再消耗 Credits」。这正是我想验证的:当 Perplexity 把 AI Agent 整套 harness 搬到你自己的硬件上跑,「零 Token 成本」到底是营销话术还是真本事?
这篇文章,我(Apisit Lee,本站作者)会拆解 Portable Computer 的真实账本、硬件门槛,并用 Ollama + Qwen3.8-27B + OpenCode 复刻一个能在 24 GB 显卡上跑的本地 Agent 工作流。最后给一张”本地 vs 云端订阅”的算账表,帮助你判断这款产品值不值得上。
一、Portable Computer 到底是什么 / 不是什么
1.1 名字的误导
The Register 在评测里吐槽得很直接:「Portable Computer 这个名字容易让人以为是新的笔记本或独立硬件。」其实不是。它不是新设备,而是 Perplexity 现有的云端 Agent 产品 Computer 的本地化版本。
要把混淆讲清楚:
– 硬件:依旧跑在你现有的 NVIDIA 设备上(首发是 DGX Spark 一体机)
– 软件:Perplexity Computer 的 harness(orchestrator + planner + tool router + scheduler + 本地 search index)在本地运行
– 模型:默认装载 Qwen 3.8 27B(社区已发布,开源 Apache-style 协议),或 Perplexity 后训练的 PPLX 27B
1.2 关键事实速览(截至 8 月 26 日)
| 项目 | 数据 |
|---|---|
| 首发模型 | Qwen 3.8 27B(256K 上下文,>100K 后开始衰减)/ PPLX 27B |
| 后续模型 | NVIDIA Nemotron 3.5 Lightning 30B(MoE)即将加入 |
| 首发硬件 | NVIDIA DGX Spark(GB10 Grace Blackwell,20 核 ARM CPU,128 GB 统一内存) |
| 第二波硬件门槛 | 任何 ≥24 GB VRAM 的 RTX GPU(RTX 3090 起,9 月上线 Windows) |
| 当前平台 | Linux(DGX Spark + 任何 ≥24 GB VRAM 的 RTX 卡) |
| 订阅 | Perplexity Pro / Max / Enterprise 订阅可用 |
| 安装方式 | Perplexity App 内一键 setup |
| 集成 | Google Drive、Gmail、Slack、GitHub |
| 云端升级触发 | 用户手动授权后才升级;便携端保留执行权 |
| 沙箱 | OS-level 沙箱,限制进程、filesystem、network |
| 自家基准 | Local Knowledge Work Bench(53 任务)82.6%(vs Pi 77.6% / Hermes 74%);ParseBench-100 上 65.1%(vs Hermes 34.6% / Pi 13.9%) |
(数据来源:Perplexity 官方博客 / SiliconANGLE / The New Stack / The Register)
1.3 与云端 Computer 的本质区别
云端 Perplexity Computer 用的是更大的闭源模型(典型调用 Sonnet 4.5 / GPT-5.6)。Portable Computer 受显存约束,只能塞下 27B 量级的开源模型。Perplexity 用 3 招弥补能力差距:
- 后训练:PPLX 27B 是基于 Qwen 3.8 27B 再训练、本地优先的版本
- Multi-Token Prediction:MTP 加速,长上下文场景下首 token 延迟更低
- Context Compaction:>100K tokens 后自动压缩摘要,避免 Qwen 3.8 27B 上下文超载
代价是:复杂推理任务(例如多步骤市场调研)仍要授权升级云端——Portable Computer 是 “本地优先,不是完全离线“。
二、「零 Token 成本」的三个真实账本
宣传话术省掉的最重要三个字是”零 token 费“,但钱只是成本的一部分。Portable Computer 真实账本要算的是:
2.1 硬件成本(一次性大头)
| 选项 | 大致价格 | 备注 |
|---|---|---|
| NVIDIA DGX Spark(GB10) | $4,800 | 128 GB 统一内存,PC 形态 |
| RTX 3090(24 GB)二手 | $1,500+ | 多伦多当前现货受 RAMmageddon 影响涨价 |
| RTX 5080(16 GB) | $999 | 不够 24GB,本地 Agent 跑不满 Qwen3.8-27B |
| Apple Mac Studio M3 Ultra(512 GB 统一内存) | ≈¥65,000 | 不是纯 NVIDIA 平台,但能跑 |
我的看法:要跑到 Perplexity 给的体验基线,至少要 RTX 3090 级别(24 GB VRAM)。$1,500 入门门槛对个人开发者偏高,但和两年订阅 Cloud Computer 相比,长期能省回来。
2.2 电费成本(持续性大头)
DGX Spark 空载功率约 120 W,满载推理峰值 350 W。假设每天跑 5 小时、$0.15 / kWh:
350 W × 5 h × 30 d × $0.15 / 1000 = $7.875 / 月
RTX 3090 推理峰值约 350 W,入门级整机电费差不多。
这意味着本地 Agent 的”零 token 成本”实际是”$8/月电费 + $0 token“——比 Pro 订阅($20/月)便宜,但比你想的多。
2.3 机会成本(最容易被忽略)
Portable Computer 的核心限制是 27B 模型的能力天花板。Perplexity 自家基准 82.6% 的成绩是好看的,但 53 任务是内部测试集,真实工作流中复杂规划仍要升级到云端 Sonnet/GPT-5.6。
换句话说,Portable Computer 不能完全替代云端 Computer——它的省钱前提是你愿意为”本地能跑的部分“支付硬件+电费。
三、你需要的硬件配置(实操清单)
如果你打算跳过 Perplexity 自家产品,自己复刻 80% 的 Portable Computer 工作流,最低门槛是:
| 角色 | 推荐配置 | 备注 |
|---|---|---|
| GPU | NVIDIA RTX 3090 / 4090(≥24 GB VRAM) | Qwen3.8-27B 量化后约 16-17 GB |
| CPU | 8 核以上 | Ollama 量化版本需要混合 CPU/GPU |
| 内存 | ≥32 GB DDR4 | 大上下文必备 |
| 磁盘 | ≥50 GB SSD | 模型权重 + 缓存 |
| OS | Linux(Ubuntu 24.04 LTS 验证)/ macOS 14+ | macOS 用 MLX 后端 |
Apple Silicon 用户:可以用 qwen3.8:27b-mlx 模型(MLX 4-bit 约 16.1 GB),但 M1/M2 系列统一内存 16 GB 跑不动,建议 M3 Max/Ultra(≥64 GB)。
国内用户注意:DGX Spark 的 GB10 是 ARM 架构,装部分 Python 包时可能遇到 wheel 不兼容问题;先建 conda venv 隔离。
四、复刻教程:Ollama + OpenCode + Qwen3.8-27B 跑本地 Agent
Portable Computer 的核心由 3 块组成:(a) 本地模型推理 + (b) Agent harness + (c) 工具调用沙箱。我们用开源工具逐个对接:
4.1 安装 Ollama 并拉模型
# macOS / Linux 一行安装
curl -fsSL https://ollama.com/install.sh | sh
# 启动服务
ollama serve &
# 拉 Qwen3.8-27B(量化后约 17 GB;详见 <a href="https://ollama.com/library/qwen3.8" class="external-link" target="_blank" rel="nofollow noopener">Ollama 官方库</a>)
ollama run qwen3.8:27b
# 验证
>>> 你好,请用一句话介绍你自己如果你显存不足,切换到更小模型:
ollama pull qwen3.5:14b # 14B,~9 GB
ollama pull qwen3.5:7b # 7B,~4.6 GB4.2 用 OpenCode 跑 Agent harness
OpenCode 是 Hermes 项目的 Agent harness,比 Perplexity Computer 的公开 benchmark(Hermes 74%)稍弱,但本地跑够用:
# 用 npm 或 pnpm
npm i -g @opencode-ai/cli
# 用 Ollama 当后端
export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollama
opencode chat --model qwen3.8:27b4.3 给 Agent 接本地工具
Portable Computer 的核心是”本地文件系统 + GitHub + Google Drive 联动“。我们可以用 OpenCode 的 skills 配置复刻:
# 创建 skill 目录
mkdir -p ~/.opencode/skills/local-files
cat > ~/.opencode/skills/local-files/SKILL.md <<'EOF'
# 本地文件扫描
当用户要求"扫描 ~/Documents/pdf-bills"时:
1. 调用 read_dir 列出所有 PDF
2. 用本地 pdftotext 提取文字
3. 把摘要返回用户,禁止离开本机
EOF提示:以下 SKILL.md 只是最小的演示骨架。真实工作流里你需要给 Agent 接
pdftotext/ollama调用接口,并基于你常处理的文件类型扩展工具路由。建议在第一次跑通后,把每次出错的子任务记到一个feedback.md里,下次跑同类型任务时先用 RAG 检索历史错误。
4.4 触发”升级云端”的工作流
Portable Computer 真正聪明的设计是”本地能跑就跑、跑不动再问用户要不要上云”。你可以让 OpenCode 在尝试 3 次工具失败后弹出确认:
# OpenCode 自定义 fallback:触发 Claude API
cat >> ~/.opencode/config.yaml <<'EOF'
fallbacks:
after_retries: 3
prompt: "本地模型连续失败 3 次,是否授权升级到 Claude API(每次约 $0.04)?"
EOF五、本地 vs 云端订阅对比表(截至 2026-08-26)
| 维度 | 本地 RTX 3090 + Ollama + OpenCode | Perplexity Portable Computer | Perplexity Pro 订阅(云端 Computer) |
|---|---|---|---|
| 首期硬件成本 | $1,500+(二手 RTX 3090) | $4,800(DGX Spark) | $0 |
| 每月电费 | 约 $8 | 约 $8 | $0 |
| 每月订阅 | $0 | $20+(Pro/Max) | $20 |
| 30 个月总成本 | ≈ $1,740 | ≈ $5,640 | ≈ $600 |
| 模型能力(推理) | Qwen3.8-27B(开源) | PPLX 27B / Qwen3.8-27B | Sonnet 4.5 / GPT-5.6(闭源前沿) |
| Agent benchmark | 取决于 harness(OpenCode ~ Hermes 基线 74% / DeepSeek Harness 多任务评测较高) | 82.6%(自家 53 任务) | Perplexity 公开未给 |
| 数据主权 | 完全本地 | 完全本地 | 数据上行云端 |
| 集成 | 自接 Gmail/GitHub API | Google Drive、Gmail、Slack、GitHub 官方 | 同上 |
| 复杂规划 | 受 Qwen3.8-27B 上限约束 | 同上 | 可用前沿模型 |
| 首次部署时间 | 1-2 小时 | 一键安装 | 即开即用 |
| macOS / iOS | ✅(MLX) | ❌(Linux only,9 月起 Windows) | ✅ |
表格结论:
– 想短期试水 / 低频任务:云端 Pro 订阅最划算(30 个月 $600)
– 想长期用 / 数据敏感:本地 RTX 3090 方案在 18 个月后回本(之后就是纯电费 $8/月)
– 想「硬件 + 软件一次到位」:DGX Spark 是过度方案,建议等 9 月 RTX 支持稳定
六、踩坑提醒:哪些场景不建议上
6.1 不要为「完全离线」买单
The Register 文章里特别提到:Portable Computer 的安全宣传强调”数据不出本机”,但实际工作流中用户授权升级到云端的场景并不少见——你一旦授权云端模型读 PDF,那部分数据就离开本机。
它的隐私卖点 比云端 Computer 强,但达不到 air-gap 级别。如果是真·涉密场景(医疗病历、未公开财报),仍然要自建 air-gap 集群。
6.2 不要只看自家 benchmark
Perplexity 公开的 82.6% 是 53 任务的内部测试集,远小于外部权威 benchmark(如 SWE-bench、AgentBench)。我建议读者把 Portable Computer 视为「Cloud Computer 的 70% 替代品」而不是「100% 替代」。
6.3 不要忽视 Qwen 3.8 27B 的上下文衰减
Perplexity 自己也承认:Qwen 3.8 27B 虽然原生支持 256K 上下文,但 >100K tokens 后质量开始衰减。所以”长 PDF 分析”场景建议先做 chunking,别指望一次性塞进去。
6.4 不要盲信「$0 Token」宣传
回到开头的账本:本地方案的真正成本是 硬件折旧 + 电费 + 调试时间。如果你一周只跑 1-2 次 Agent,云端订阅更划算。
七、给你的下一步建议
| 你的角色 | 建议 |
|---|---|
| 普通开发者 | 先跑 §4.1 的 Ollama + Qwen3.8-27B,周末 1 小时就能验证本地 Agent 是否够你用 |
| 隐私敏感团队(金融/医疗/咨询) | 直接对标 DGX Spark,$4,800 一次性回本周期约 24 个月 |
| AI 重度用户(日均 100+ Credits 烧光) | 算账:在 §5 表里把你的月订阅填进去,能算清楚再决定 |
| 个人尝鲜 | 跳过,等 9 月 RTX 桌面版(不止 DGX Spark)或开源 harness(如 Hermes)支持更稳 |
八、结语
Portable Computer 不是一个新硬件,而是一个把云端 Agent 搬到本地的方向。它解决的问题是真问题——每月烧光的 Credits 和不被托管的私有数据。但它的代价是一台 $4,800 的桌面电脑(或一块 $1,500 的 RTX 3090),配上一个 27B 模型的 reasoning 上限。
如果你已经在本地跑 Ollama,已经用熟了 本地部署大模型完全指南(Ollama 与 LM Studio 实战对比),那么 Portable Computer 的真正启示是:
Agent 框架的”便携性”和”能力上限”是一对矛盾——本地部署牺牲推理上限,换取数据主权与可预测成本。Portable Computer 选了硬件侧的开源(Qwen 3.8 27B),而它的同父异母兄弟——OpenAI gpt-oss-120b/20b 开源部署指南、DeepSeek Harness 开源 Agent 框架指南、OpenAI Codex Harness 开源上手指南——在向更大的开源权重和更广的 agent harness 演进。
顺带看下 OpenRouter Ox Alpha 免费试 API 调用指南——当你本地 27B 跑不动时,哪些匿名模型能立刻兜底。
如果你已经在本地跑模型,试着对照本文 §4 的步骤复刻一遍。欢迎在评论区贴出你的实测 token 成本对账表。