Ollama 云端推出非高峰时段 token 价格:两款 DeepSeek-V4 模型在工作日 12:00 至 18:00 UTC 之外及周末全天半价

Ollama 把分时电价的逻辑用到了云端 AI token 上:DeepSeek-V4-Flash 与 DeepSeek-V4-Pro 在工作日 12:00 至 18:00 UTC 之外以及周末全天均为半价。该公司表示同样的折扣很快会覆盖更多模型。此举建立在其 8 月 31 日转向按 token 计价的基础上。

Paylaş
Ollama 云端推出非高峰时段 token 价格:两款 DeepSeek-V4 模型在工作日 12:00 至 18:00 UTC 之外及周末全天半价

Ollama 在其云服务中推出了非高峰时段 token 价格。根据该公司 9 月 6 日在官方 X 账号发布的公告DeepSeek-V4-FlashDeepSeek-V4-Pro 在工作日 12:00 至 18:00 UTC 之外以及周末全天均为半价。换算成土耳其时间,高峰时段为 15:00 至 21:00。这相当于把夜间电价的逻辑搬到了 AI token 上:需求低时价格低。

价格

Ollama 的定价页面写明,高峰价格适用于周一至周五 12:00 至 18:00 UTC,非高峰价格为高峰价格的 50%。每百万 token 的非高峰价格如下:

  • DeepSeek-V4-Flash:输入 0.22 美元,缓存输入 0.007 美元,输出 0.66 美元。
  • DeepSeek-V4-Pro:输入 0.66 美元,缓存输入 0.022 美元,输出 1.98 美元。

高峰时段的价格是上述数字的两倍。目前只有这两款模型有此区分;Ollama 表示非高峰价格“很快将适用于更多模型”。

背景:转向按 token 计价

这一步接在 Ollama 8 月 31 日宣布的定价调整之后:云端计费从 GPU 时长改为按 token 计价,每个套餐包含每月用量额度。Pro 每月 20 美元(含 60 美元用量),Max 每月 100 美元(含 300 美元用量),Team 每月 500 美元(含 1000 美元共享用量,用户数不限)。免费套餐为入门模型提供少量额度;未用完的额度不结转到下月。

关于托管地点,Ollama 的说法是:每个请求都在美国和欧洲的专用算力上运行,少数 Qwen 模型使用新加坡。定价页面则称公司主要在美国托管模型与算力。X 公告补充说,DeepSeek 模型托管在美国和欧洲,采用零数据保留(ZDR)。Ollama 称不记录提示词,也绝不用客户数据训练。

对企业读者而言

把批处理负载,或夜间运行的摘要与分类任务,挪到非高峰时段的机构,在这两款模型上可以把账单减半。至于很快将适用于更多模型的说法,目前仍只是承诺,没有日期。数据究竟在美国还是欧洲处理,从 GDPR 和土耳其 KVKK 的角度值得一问:Ollama 列出了两个区域,但没有说明客户能否在其间选择。

来源