Perplexity × NVIDIA Portable Computer 上手指南:本地跑 AI Agent 的「零 Token 成本」到底是真省还是宣传话术(含 Ollama 复刻教程)

引子:把云端 Credits 烧光之后

上周翻自己的 Perplexity 月账单,发现一个尴尬的事实:用 Computer 模式做”读 PDF → 整理字段 → 写 Markdown”的常规任务,单次任务能消耗 1.5~4 Credits。一个月下来,几百块订阅不够烧——尤其是当 Agent 要跑几轮子任务时。

8 月 25 日,Perplexity 联合 NVIDIA 推出 Portable Computer,一句话承诺:「本地任务不再消耗 Credits」。这正是我想验证的:当 Perplexity 把 AI Agent 整套 harness 搬到你自己的硬件上跑,「零 Token 成本」到底是营销话术还是真本事?

这篇文章,我(Apisit Lee,本站作者)会拆解 Portable Computer 的真实账本、硬件门槛,并用 Ollama + Qwen3.8-27B + OpenCode 复刻一个能在 24 GB 显卡上跑的本地 Agent 工作流。最后给一张”本地 vs 云端订阅”的算账表,帮助你判断这款产品值不值得上。

一、Portable Computer 到底是什么 / 不是什么

1.1 名字的误导

The Register 在评测里吐槽得很直接:「Portable Computer 这个名字容易让人以为是新的笔记本或独立硬件。」其实不是。它不是新设备,而是 Perplexity 现有的云端 Agent 产品 Computer 的本地化版本。

要把混淆讲清楚:
硬件:依旧跑在你现有的 NVIDIA 设备上(首发是 DGX Spark 一体机)
软件:Perplexity Computer 的 harness(orchestrator + planner + tool router + scheduler + 本地 search index)在本地运行
模型:默认装载 Qwen 3.8 27B(社区已发布,开源 Apache-style 协议),或 Perplexity 后训练的 PPLX 27B

1.2 关键事实速览(截至 8 月 26 日)

项目数据
首发模型Qwen 3.8 27B(256K 上下文,>100K 后开始衰减)/ PPLX 27B
后续模型NVIDIA Nemotron 3.5 Lightning 30B(MoE)即将加入
首发硬件NVIDIA DGX Spark(GB10 Grace Blackwell,20 核 ARM CPU,128 GB 统一内存)
第二波硬件门槛任何 ≥24 GB VRAM 的 RTX GPU(RTX 3090 起,9 月上线 Windows
当前平台Linux(DGX Spark + 任何 ≥24 GB VRAM 的 RTX 卡)
订阅Perplexity Pro / Max / Enterprise 订阅可用
安装方式Perplexity App 内一键 setup
集成Google Drive、Gmail、Slack、GitHub
云端升级触发用户手动授权后才升级;便携端保留执行权
沙箱OS-level 沙箱,限制进程、filesystem、network
自家基准Local Knowledge Work Bench(53 任务)82.6%(vs Pi 77.6% / Hermes 74%);ParseBench-100 上 65.1%(vs Hermes 34.6% / Pi 13.9%)

(数据来源:Perplexity 官方博客 / SiliconANGLE / The New Stack / The Register)

1.3 与云端 Computer 的本质区别

云端 Perplexity Computer 用的是更大的闭源模型(典型调用 Sonnet 4.5 / GPT-5.6)。Portable Computer 受显存约束,只能塞下 27B 量级的开源模型。Perplexity 用 3 招弥补能力差距:

  1. 后训练:PPLX 27B 是基于 Qwen 3.8 27B 再训练、本地优先的版本
  2. Multi-Token Prediction:MTP 加速,长上下文场景下首 token 延迟更低
  3. Context Compaction:>100K tokens 后自动压缩摘要,避免 Qwen 3.8 27B 上下文超载

代价是:复杂推理任务(例如多步骤市场调研)仍要授权升级云端——Portable Computer 是 “本地优先,不是完全离线“。

二、「零 Token 成本」的三个真实账本

宣传话术省掉的最重要三个字是”零 token 费“,但钱只是成本的一部分。Portable Computer 真实账本要算的是:

2.1 硬件成本(一次性大头)

选项大致价格备注
NVIDIA DGX Spark(GB10)$4,800128 GB 统一内存,PC 形态
RTX 3090(24 GB)二手$1,500+多伦多当前现货受 RAMmageddon 影响涨价
RTX 5080(16 GB)$999不够 24GB,本地 Agent 跑不满 Qwen3.8-27B
Apple Mac Studio M3 Ultra(512 GB 统一内存)≈¥65,000不是纯 NVIDIA 平台,但能跑

我的看法:要跑到 Perplexity 给的体验基线,至少要 RTX 3090 级别(24 GB VRAM)。$1,500 入门门槛对个人开发者偏高,但和两年订阅 Cloud Computer 相比,长期能省回来。

2.2 电费成本(持续性大头)

DGX Spark 空载功率约 120 W,满载推理峰值 350 W。假设每天跑 5 小时、$0.15 / kWh:

350 W × 5 h × 30 d × $0.15 / 1000 = $7.875 / 月

RTX 3090 推理峰值约 350 W,入门级整机电费差不多。

这意味着本地 Agent 的”零 token 成本”实际是”$8/月电费 + $0 token“——比 Pro 订阅($20/月)便宜,但比你想的多

2.3 机会成本(最容易被忽略)

Portable Computer 的核心限制是 27B 模型的能力天花板。Perplexity 自家基准 82.6% 的成绩是好看的,但 53 任务是内部测试集,真实工作流中复杂规划仍要升级到云端 Sonnet/GPT-5.6。

换句话说,Portable Computer 不能完全替代云端 Computer——它的省钱前提是你愿意为”本地能跑的部分“支付硬件+电费。

三、你需要的硬件配置(实操清单)

如果你打算跳过 Perplexity 自家产品,自己复刻 80% 的 Portable Computer 工作流,最低门槛是:

角色推荐配置备注
GPUNVIDIA RTX 3090 / 4090(≥24 GB VRAM)Qwen3.8-27B 量化后约 16-17 GB
CPU8 核以上Ollama 量化版本需要混合 CPU/GPU
内存≥32 GB DDR4大上下文必备
磁盘≥50 GB SSD模型权重 + 缓存
OSLinux(Ubuntu 24.04 LTS 验证)/ macOS 14+macOS 用 MLX 后端

Apple Silicon 用户:可以用 qwen3.8:27b-mlx 模型(MLX 4-bit 约 16.1 GB),但 M1/M2 系列统一内存 16 GB 跑不动,建议 M3 Max/Ultra(≥64 GB)

国内用户注意:DGX Spark 的 GB10 是 ARM 架构,装部分 Python 包时可能遇到 wheel 不兼容问题;先建 conda venv 隔离。

四、复刻教程:Ollama + OpenCode + Qwen3.8-27B 跑本地 Agent

Portable Computer 的核心由 3 块组成:(a) 本地模型推理 + (b) Agent harness + (c) 工具调用沙箱。我们用开源工具逐个对接:

4.1 安装 Ollama 并拉模型

Bash
# macOS / Linux 一行安装
curl -fsSL https://ollama.com/install.sh | sh

# 启动服务
ollama serve &

# 拉 Qwen3.8-27B(量化后约 17 GB;详见 <a href="https://ollama.com/library/qwen3.8" class="external-link" target="_blank" rel="nofollow noopener">Ollama 官方库</a>)
ollama run qwen3.8:27b

# 验证
>>> 你好,请用一句话介绍你自己

如果你显存不足,切换到更小模型:

Bash
ollama pull qwen3.5:14b     # 14B,~9 GB
ollama pull qwen3.5:7b      # 7B,~4.6 GB

4.2 用 OpenCode 跑 Agent harness

OpenCode 是 Hermes 项目的 Agent harness,比 Perplexity Computer 的公开 benchmark(Hermes 74%)稍弱,但本地跑够用:

Bash
# 用 npm 或 pnpm
npm i -g @opencode-ai/cli

# 用 Ollama 当后端
export OPENAI_BASE_URL=http://localhost:11434/v1
export OPENAI_API_KEY=ollama
opencode chat --model qwen3.8:27b

4.3 给 Agent 接本地工具

Portable Computer 的核心是”本地文件系统 + GitHub + Google Drive 联动“。我们可以用 OpenCode 的 skills 配置复刻:

Bash
# 创建 skill 目录
mkdir -p ~/.opencode/skills/local-files

cat > ~/.opencode/skills/local-files/SKILL.md <<'EOF'
# 本地文件扫描
当用户要求"扫描 ~/Documents/pdf-bills"时:
1. 调用 read_dir 列出所有 PDF
2. 用本地 pdftotext 提取文字
3. 把摘要返回用户,禁止离开本机
EOF

提示:以下 SKILL.md 只是最小的演示骨架。真实工作流里你需要给 Agent 接 pdftotext / ollama 调用接口,并基于你常处理的文件类型扩展工具路由。建议在第一次跑通后,把每次出错的子任务记到一个 feedback.md 里,下次跑同类型任务时先用 RAG 检索历史错误。

4.4 触发”升级云端”的工作流

Portable Computer 真正聪明的设计是”本地能跑就跑、跑不动再问用户要不要上云”。你可以让 OpenCode 在尝试 3 次工具失败后弹出确认:

Bash
# OpenCode 自定义 fallback:触发 Claude API
cat >> ~/.opencode/config.yaml <<'EOF'
fallbacks:
  after_retries: 3
  prompt: "本地模型连续失败 3 次,是否授权升级到 Claude API(每次约 $0.04)?"
EOF

五、本地 vs 云端订阅对比表(截至 2026-08-26)

维度本地 RTX 3090 + Ollama + OpenCodePerplexity Portable ComputerPerplexity Pro 订阅(云端 Computer)
首期硬件成本$1,500+(二手 RTX 3090)$4,800(DGX Spark)$0
每月电费约 $8约 $8$0
每月订阅$0$20+(Pro/Max)$20
30 个月总成本$1,740$5,640$600
模型能力(推理)Qwen3.8-27B(开源)PPLX 27B / Qwen3.8-27BSonnet 4.5 / GPT-5.6(闭源前沿)
Agent benchmark取决于 harness(OpenCode ~ Hermes 基线 74% / DeepSeek Harness 多任务评测较高)82.6%(自家 53 任务)Perplexity 公开未给
数据主权完全本地完全本地数据上行云端
集成自接 Gmail/GitHub APIGoogle Drive、Gmail、Slack、GitHub 官方同上
复杂规划受 Qwen3.8-27B 上限约束同上可用前沿模型
首次部署时间1-2 小时一键安装即开即用
macOS / iOS✅(MLX)❌(Linux only,9 月起 Windows)

表格结论
– 想短期试水 / 低频任务:云端 Pro 订阅最划算(30 个月 $600)
– 想长期用 / 数据敏感:本地 RTX 3090 方案在 18 个月后回本(之后就是纯电费 $8/月)
– 想「硬件 + 软件一次到位」:DGX Spark 是过度方案,建议等 9 月 RTX 支持稳定

六、踩坑提醒:哪些场景不建议上

6.1 不要为「完全离线」买单

The Register 文章里特别提到:Portable Computer 的安全宣传强调”数据不出本机”,但实际工作流中用户授权升级到云端的场景并不少见——你一旦授权云端模型读 PDF,那部分数据就离开本机。

它的隐私卖点 比云端 Computer 强,但达不到 air-gap 级别。如果是真·涉密场景(医疗病历、未公开财报),仍然要自建 air-gap 集群。

6.2 不要只看自家 benchmark

Perplexity 公开的 82.6% 是 53 任务的内部测试集,远小于外部权威 benchmark(如 SWE-bench、AgentBench)。我建议读者把 Portable Computer 视为「Cloud Computer 的 70% 替代品」而不是「100% 替代」。

6.3 不要忽视 Qwen 3.8 27B 的上下文衰减

Perplexity 自己也承认:Qwen 3.8 27B 虽然原生支持 256K 上下文,但 >100K tokens 后质量开始衰减。所以”长 PDF 分析”场景建议先做 chunking,别指望一次性塞进去。

6.4 不要盲信「$0 Token」宣传

回到开头的账本:本地方案的真正成本是 硬件折旧 + 电费 + 调试时间。如果你一周只跑 1-2 次 Agent,云端订阅更划算。

七、给你的下一步建议

你的角色建议
普通开发者先跑 §4.1 的 Ollama + Qwen3.8-27B,周末 1 小时就能验证本地 Agent 是否够你用
隐私敏感团队(金融/医疗/咨询)直接对标 DGX Spark,$4,800 一次性回本周期约 24 个月
AI 重度用户(日均 100+ Credits 烧光)算账:在 §5 表里把你的月订阅填进去,能算清楚再决定
个人尝鲜跳过,等 9 月 RTX 桌面版(不止 DGX Spark)或开源 harness(如 Hermes)支持更稳

八、结语

Portable Computer 不是一个新硬件,而是一个把云端 Agent 搬到本地的方向。它解决的问题是真问题——每月烧光的 Credits 和不被托管的私有数据。但它的代价是一台 $4,800 的桌面电脑(或一块 $1,500 的 RTX 3090),配上一个 27B 模型的 reasoning 上限。

如果你已经在本地跑 Ollama,已经用熟了 本地部署大模型完全指南(Ollama 与 LM Studio 实战对比),那么 Portable Computer 的真正启示是:

Agent 框架的”便携性”和”能力上限”是一对矛盾——本地部署牺牲推理上限,换取数据主权与可预测成本。Portable Computer 选了硬件侧的开源(Qwen 3.8 27B),而它的同父异母兄弟——OpenAI gpt-oss-120b/20b 开源部署指南DeepSeek Harness 开源 Agent 框架指南OpenAI Codex Harness 开源上手指南——在向更大的开源权重和更广的 agent harness 演进。

顺带看下 OpenRouter Ox Alpha 免费试 API 调用指南——当你本地 27B 跑不动时,哪些匿名模型能立刻兜底。

如果你已经在本地跑模型,试着对照本文 §4 的步骤复刻一遍。欢迎在评论区贴出你的实测 token 成本对账表。

推荐阅读

  • Perplexity × NVIDIA Portable Computer 上手指南:本地跑 AI Agent 的「零 Token 成本」到底是真省还是宣传话术(含 Ollama 复刻教程)

    Perplexity 联合 NVIDIA 推出 Portable Computer,把 AI Agent 整套 harness 搬到本地运行,本地任务不消耗云端 Credits。本文拆解「零 Toke…

  • OpenAI 把 Codex 的”大脑”开源了:Codex Harness 上手指南,三层接口从 CI 到产品全打通

    OpenAI 开源 Codex Harness 底层执行框架,不是模型而是模型的’外骨骼’。同一 GPT-5.6 Sol 仅靠 Harness 优化,ARC-AGI-3 得分从 13.3% 涨到 38…

  • OpenRouter 上冒出一个不署名的前沿模型:Ox Alpha 免费试,三步跑通 API 调用

    OpenRouter 上出现了一个匿名模型 Ox Alpha,1M 上下文、支持图文视频多模态输入、编程跑分超过 GPT-5.6。本文教你用 curl 和 Python 三步跑通 API 调用,附隐私…

  • Claude 现在能替你发邮件、管 Drive 了:Google Workspace 连接器实测与上手

    Claude 的 Google Workspace 连接器升级后,能直接发送 Gmail、回复邮件、管理 Drive 文件。本文实测开通流程、权限边界与 3 个真实办公场景,并提醒哪些操作不建议交给 …