TOKEN FACTORY · SHENZHEN NVIDIA CLUSTER

大模型时代的
Token 源头供应商

自有 NVIDIA 高端算力集群,规模化部署 GLM-5.2 等开源旗舰模型。没有中间环节,以显著低于官方牌价的源头价格,供应可验证、可承诺 SLA 的推理产能。

OpenAI 兼容 API · 替换 base_url 即接入 · 1M 上下文 · 深圳IDC机房

beyray-inference · glm-5.2-nvfp4 · sglang

output throughput

7,200tok/s·实例

ttft p90 (8K · 80% cache)

<0.4s

stable concurrency

340req·实例

cached input peak

120Ktok/s·实例

req#4821 · 8K in · cache hit 81% · ttft 212ms · 1,024 tok out · 200 OK

req#4822 · 1K in · cache miss · ttft 96ms · 512 tok out · 200 OK

req#4823 · 8K in · cache hit 79% · ttft 187ms · 2,048 tok out · 200 OK

req#4824 · 80K in · cache hit 80% · ttft 1.9s · 700 tok out · 200 OK

req#4825 · 8K in · cache hit 83% · ttft 154ms · 896 tok out · 200 OK

↑ 2026-07 内部压测数据,完整报告可按需提供

99.9%

月度可用性 SLA,未达标以 Token 额度赔付

源头价

用量分级折扣,月日均用量越大价格越优

72h

不限量免费试用,专属群技术值守

MIT

开源协议合法商用,部署信息可验证

ruì · 百川汇流之处 · where streams converge

Brand Story

汭,百川汇流之处

「佰」是百川之众,「汭」是水流交汇之地。我们相信,智能终将像水和电一样,成为按需取用、无处不在的基础资源,而这需要有人在源头,把算力、模型与工程能力汇成一股稳定的供给。

这就是佰汭:让开源模型的智能从自有算力集群出发,如活水般流向每一位开发者、每一家企业、每一个平台。不加价的中间层越少,这股水流就越清澈、越有力。

Mission

使命:让每一份智能产能物尽其用,把大模型的使用成本降到源头价

Vision

愿景:成为大模型时代最值得信赖的 Token 源头供应商

Values

价值观:透明可验证,承诺必兑现,与客户长期同行

Benchmark

用实测数据说话

NVIDIA 单实例 · GLM-5.2(NVFP4 精度)· SGLang 推理引擎 · 2026 年 7 月压测。我们把真实数字放在官网上,因为源头供应商经得起验证。

典型负载场景缓存命中率稳定并发 / 实例TTFT P90输出吞吐 (tok/s)TPOT P90
短上下文对话(1K)-≈ 340< 0.6 s≈ 7,200≈ 55 ms
Agent / 编程(8K)80%≈ 230< 0.4 s≈ 7,200≈ 42 ms
长文档处理(80K)80%≈ 40< 4 s≈ 700≈ 74 ms
超长上下文(256K)80%≈ 13< 35 s≈ 240≈ 112 ms

TTFT = 首字延迟;TPOT = 每输出 token 耗时。数据为内部压测结果,供选型参考;合同承诺以 SLA 条款为准。集群容量按需横向扩展,支持业务峰值预约扩容。

Pricing

用量分级定价,越用越优

按月日均消耗量(当月消耗总量 ÷ 当月天数)自动归档,当月全部用量整体适用所达档位,月末核定,无需预付锁档。支持 GLM、DeepSeek 等多款开源旗舰模型,各模型折扣不同,具体以报价单为准。

标准档

基础优惠

低于官方牌价

月日均消耗 < 50 亿 tokens

  • 按量付费,零门槛接入
  • 全功能 API:流式 / Function Call / 思考模式 / 结构化输出
  • 前缀缓存自动生效,命中按缓存价计费

支持 GLM、DeepSeek 等开源旗舰模型,各模型折扣详见报价单

进阶档

深度优惠

折扣随量升档

月日均消耗 50-500 亿 tokens

  • 整单适用档位单价,自动升档
  • TPM / RPM 负载阈值随业务协商上调
  • Batch 批量任务享折上折优惠

折扣随月日均用量自动升档,无需谈判、无需锁档

战略档

战略底价

年度框架专享

月日均消耗 ≥ 500 亿 tokens,年度框架

  • 专属容量保障与扩容优先级
  • 定制 SLA 与负载阈值
  • 专属实例 / 白牌供给方案可选

年度框架锁定专属底价与容量保障,白牌 / 专属实例可选

价格含税,可开具增值税专用发票 · 各模型单价与折扣以当期报价单为准,随官方牌价联动调整

获取完整报价单

Service Level Agreement

敢承诺,能兑现

SLA 不是营销数字,是写进合同的条款。未达标即以 Token 服务额度自动补偿,监控数据可核对,申请流程明确。

月度服务可用性承诺

99.9%

按 5 分钟错误率窗口统计,可用性区间对应当月消费额 5%-50% 的 Token 额度补偿,自动计入次月账户;可用性低于 95% 时客户享有无责终止权。

< 32K 输入

TTFT ≤3s 请求占比 ≥ 90%,≤ 6s 占比 ≥ 99%;单请求输出速率 P50 ≥ 15 tok/s

32K-128K

TTFT ≤ 10s 请求占比 ≥ 90%;单请求输出速率 P50 ≥ 10 tok/s

≥ 128K

TTFT ≤ 60s 请求占比 ≥ 90%(建议专属实例承载,指标可另行约定)

延迟承诺同样有赔付:任一延迟指标未达标的自然日,补偿当日消费额 10% 的 Token 额度。完整定义、除外情形与申请流程详见《用量分级定价与 SLA 承诺》,签约即附。

Products

三种接入形态,一套 API 标准

从敏捷试用到严苛合规,全线方案共用同一套 OpenAI 兼容接口,业务在不同形态间迁移零成本。

Shared API

标准 API 接入

  • 共享算力池,按 tokens 用量计费
  • 流式输出 / Function Call / 思考模式 / 1M 上下文
  • Batch 批量任务 24h 交付,价格更优
  • 控制台统一查看用量与账单

适合:个人开发者、初创团队、产品验证与中等规模生产

Dedicated

专属推理实例

  • 独享 GPU 节点,物理级资源隔离
  • 固定并发保障,峰值弹性扩容
  • 超长上下文(≥128K)稳定承载首选
  • 可定制 SLA 与专属监控看板

适合:中大型企业、高并发生产环境、API 平台批发

Private

私有化部署

  • 模型权重与推理引擎全量交付客户侧
  • 支持离网部署,数据 100% 不出域
  • 安全审计与二次开发定制
  • 满足等保三级等行业合规要求

适合:金融、政务、医疗等高合规行业

Who We Serve

为整个 Token 生态供货

典型场景:Agentic Coding · 长程智能体 · 项目级工程交付 · 批量数据加工 · 高并发对话。

个人开发者

零迁移成本接入,按量付费无门槛

企业客户

编程助手、智能体、客服的稳定供给,SLA 兜底

API 中转 / 聚合平台

源头价差空间充足,容量可承诺、可转售

云厂商

MaaS 产能补充与峰值弹性,支持白牌供给

大模型厂商

推理产能外包,缓解自有集群峰值压力

TOKEN FACTORY

我们不转售智能,
我们生产智能。

BEYRAY · TOKEN FACTORY · SHENZHEN

About Beyray

算力有集团级硬件基因

上海佰汭科技有限公司是深圳市佰内科技有限公司(lepaine.tech)集团成员企业。集团深耕高端 AI 算力设备芯片级维修与运维,A100 / H100 / H200 等 GPU 芯片级修复、整机测试验证、三级备件网络与 7×24 应急响应。

这意味着佰汭的算力集群拥有多数 Token 供应商不具备的东西:故障发生时,修得快、备件足、有兜底。稳定性不是口号,是集团十余年硬件运维能力的自然延伸。

模型合规

GLM-5.2 依 MIT 开源协议发布,明确允许商用;部署信息透明,欢迎基准复现与盲测验证。

监管合规

依照《生成式人工智能服务管理暂行办法》及数据安全相关法规履约,配合客户完成备案协作。

数据安全

请求与生成数据仅用于完成推理,严禁用于训练;全程 TLS 加密,支持定制日志留存或零留存方案。

国产化路线

未来将开启华为昇腾、寒武纪等国产芯片适配预研,面向信创场景的纯国产推理集群在规划中。

集团硬件基因

多年高端 GPU 芯片级维修与运维积淀(lepaine.tech)

佰汭成立

聚焦大模型 Token 解决方案,确立源头供应商定位

集群投产

深圳IDC机房,NVIDIA高端算力集群规模化部署

GLM-5.2 上线

开源旗舰模型规模化供给,开放 3 天不限量试用

国产化预研

华为昇腾、寒武纪适配启动,信创集群规划中

FAQ

常见问题

技术买家最常问的几件事,我们直接写在官网上。

你们的 token 是什么来源?合规吗?+

我们基于自有 NVIDIA 高端算力集群部署开源大模型 GLM-5.2 提供推理服务。GLM-5.2 由智谱 AI 依 MIT 开源协议发布,协议明确允许商业化使用,我方在许可范围内合法部署与供给,不存在合规风险。

我问模型“你是谁”,它回答的身份不对,是不是模型作假?+

不是。大模型普遍存在“幻觉”,对自身身份、训练来源等元信息的回答并不可靠,即使各官方平台的原厂模型也经常自称为其他模型,因此模型自述不能作为判断真实身份的依据。如需验证,我们可提供部署所用的模型版本与权重来源等信息,也欢迎通过公开基准复现、开源权重行为对比、盲测等客观方式验证。我们对服务真实性完全开放。

服务稳定吗?出问题怎么办?+

正式合作提供月度可用性不低于 99.9% 的 SLA,延迟指标同样写入合同;任一承诺未达标即以 Token 服务额度形式补偿(可用性区间对应当月消费额 5%-50%),自动计入次月账户。部署初期如遇偶发波动,试用群内工程师会第一时间定位处理。

接入要改多少代码?+

接近于零。我们提供 OpenAI 兼容 API,替换 base_url 与 API Key 即可切换,支持流式输出、Function Call、思考模式、上下文缓存与结构化输出,1M 上下文、128K 最大输出。

试用怎么申请?有什么限制?+

提交客户类型(个人 / 企业 / API 中转站 / 云厂商 / 大模型厂商)、模型需求、业务场景与预估 TPM/RPM 后,1 个工作日内开通。自 Key 激活起 72 小时内 token 用量不设上限,可自由压测;到期自动失效、不产生费用。开通同时邀请进入专属试用群,技术问题随时反馈。

我的数据会被用来训练吗?+

不会。请求与生成数据仅用于完成本次推理,严禁用于模型训练或提供给第三方,商务协议明确约定;传输全程 TLS 加密,可按需配置日志留存策略或零留存方案。

Start Now

3 天不限量试用,用数据说话

不看 PPT,看压测。72 小时内 token 用量不设上限,专属群工程师全程值守,跑完你自己的 benchmark 再决定。

1提交试用申请2开通 API Key3加入专属试用群472h 不限量压测5报价与签约