标准档
基础优惠
低于官方牌价
月日均消耗 < 50 亿 tokens
- 按量付费,零门槛接入
- 全功能 API:流式 / Function Call / 思考模式 / 结构化输出
- 前缀缓存自动生效,命中按缓存价计费
支持 GLM、DeepSeek 等开源旗舰模型,各模型折扣详见报价单
TOKEN FACTORY · SHENZHEN NVIDIA CLUSTER
自有 NVIDIA 高端算力集群,规模化部署 GLM-5.2 等开源旗舰模型。没有中间环节,以显著低于官方牌价的源头价格,供应可验证、可承诺 SLA 的推理产能。
OpenAI 兼容 API · 替换 base_url 即接入 · 1M 上下文 · 深圳IDC机房
output throughput
7,200tok/s·实例
ttft p90 (8K · 80% cache)
<0.4s
stable concurrency
340req·实例
cached input peak
120Ktok/s·实例
› req#4821 · 8K in · cache hit 81% · ttft 212ms · 1,024 tok out · 200 OK
› req#4822 · 1K in · cache miss · ttft 96ms · 512 tok out · 200 OK
› req#4823 · 8K in · cache hit 79% · ttft 187ms · 2,048 tok out · 200 OK
› req#4824 · 80K in · cache hit 80% · ttft 1.9s · 700 tok out · 200 OK
› req#4825 · 8K in · cache hit 83% · ttft 154ms · 896 tok out · 200 OK
↑ 2026-07 内部压测数据,完整报告可按需提供
99.9%
月度可用性 SLA,未达标以 Token 额度赔付
源头价
用量分级折扣,月日均用量越大价格越优
72h
不限量免费试用,专属群技术值守
MIT
开源协议合法商用,部署信息可验证
汭
ruì · 百川汇流之处 · where streams converge
Brand Story
「佰」是百川之众,「汭」是水流交汇之地。我们相信,智能终将像水和电一样,成为按需取用、无处不在的基础资源,而这需要有人在源头,把算力、模型与工程能力汇成一股稳定的供给。
这就是佰汭:让开源模型的智能从自有算力集群出发,如活水般流向每一位开发者、每一家企业、每一个平台。不加价的中间层越少,这股水流就越清澈、越有力。
Mission
使命:让每一份智能产能物尽其用,把大模型的使用成本降到源头价
Vision
愿景:成为大模型时代最值得信赖的 Token 源头供应商
Values
价值观:透明可验证,承诺必兑现,与客户长期同行
Benchmark
NVIDIA 单实例 · GLM-5.2(NVFP4 精度)· SGLang 推理引擎 · 2026 年 7 月压测。我们把真实数字放在官网上,因为源头供应商经得起验证。
| 典型负载场景 | 缓存命中率 | 稳定并发 / 实例 | TTFT P90 | 输出吞吐 (tok/s) | TPOT P90 |
|---|---|---|---|---|---|
| 短上下文对话(1K) | - | ≈ 340 | < 0.6 s | ≈ 7,200 | ≈ 55 ms |
| Agent / 编程(8K) | 80% | ≈ 230 | < 0.4 s | ≈ 7,200 | ≈ 42 ms |
| 长文档处理(80K) | 80% | ≈ 40 | < 4 s | ≈ 700 | ≈ 74 ms |
| 超长上下文(256K) | 80% | ≈ 13 | < 35 s | ≈ 240 | ≈ 112 ms |
TTFT = 首字延迟;TPOT = 每输出 token 耗时。数据为内部压测结果,供选型参考;合同承诺以 SLA 条款为准。集群容量按需横向扩展,支持业务峰值预约扩容。
Pricing
按月日均消耗量(当月消耗总量 ÷ 当月天数)自动归档,当月全部用量整体适用所达档位,月末核定,无需预付锁档。支持 GLM、DeepSeek 等多款开源旗舰模型,各模型折扣不同,具体以报价单为准。
标准档
基础优惠
低于官方牌价
月日均消耗 < 50 亿 tokens
支持 GLM、DeepSeek 等开源旗舰模型,各模型折扣详见报价单
进阶档
深度优惠
折扣随量升档
月日均消耗 50-500 亿 tokens
折扣随月日均用量自动升档,无需谈判、无需锁档
战略档
战略底价
年度框架专享
月日均消耗 ≥ 500 亿 tokens,年度框架
年度框架锁定专属底价与容量保障,白牌 / 专属实例可选
价格含税,可开具增值税专用发票 · 各模型单价与折扣以当期报价单为准,随官方牌价联动调整
Service Level Agreement
SLA 不是营销数字,是写进合同的条款。未达标即以 Token 服务额度自动补偿,监控数据可核对,申请流程明确。
月度服务可用性承诺
99.9%
按 5 分钟错误率窗口统计,可用性区间对应当月消费额 5%-50% 的 Token 额度补偿,自动计入次月账户;可用性低于 95% 时客户享有无责终止权。
< 32K 输入
TTFT ≤3s 请求占比 ≥ 90%,≤ 6s 占比 ≥ 99%;单请求输出速率 P50 ≥ 15 tok/s
32K-128K
TTFT ≤ 10s 请求占比 ≥ 90%;单请求输出速率 P50 ≥ 10 tok/s
≥ 128K
TTFT ≤ 60s 请求占比 ≥ 90%(建议专属实例承载,指标可另行约定)
延迟承诺同样有赔付:任一延迟指标未达标的自然日,补偿当日消费额 10% 的 Token 额度。完整定义、除外情形与申请流程详见《用量分级定价与 SLA 承诺》,签约即附。
Products
从敏捷试用到严苛合规,全线方案共用同一套 OpenAI 兼容接口,业务在不同形态间迁移零成本。
Shared API
适合:个人开发者、初创团队、产品验证与中等规模生产
Dedicated
适合:中大型企业、高并发生产环境、API 平台批发
Private
适合:金融、政务、医疗等高合规行业
Who We Serve
典型场景:Agentic Coding · 长程智能体 · 项目级工程交付 · 批量数据加工 · 高并发对话。
零迁移成本接入,按量付费无门槛
编程助手、智能体、客服的稳定供给,SLA 兜底
源头价差空间充足,容量可承诺、可转售
MaaS 产能补充与峰值弹性,支持白牌供给
推理产能外包,缓解自有集群峰值压力
TOKEN FACTORY
我们不转售智能,
我们生产智能。
BEYRAY · TOKEN FACTORY · SHENZHEN
About Beyray
上海佰汭科技有限公司是深圳市佰内科技有限公司(lepaine.tech)集团成员企业。集团深耕高端 AI 算力设备芯片级维修与运维,A100 / H100 / H200 等 GPU 芯片级修复、整机测试验证、三级备件网络与 7×24 应急响应。
这意味着佰汭的算力集群拥有多数 Token 供应商不具备的东西:故障发生时,修得快、备件足、有兜底。稳定性不是口号,是集团十余年硬件运维能力的自然延伸。
GLM-5.2 依 MIT 开源协议发布,明确允许商用;部署信息透明,欢迎基准复现与盲测验证。
依照《生成式人工智能服务管理暂行办法》及数据安全相关法规履约,配合客户完成备案协作。
请求与生成数据仅用于完成推理,严禁用于训练;全程 TLS 加密,支持定制日志留存或零留存方案。
未来将开启华为昇腾、寒武纪等国产芯片适配预研,面向信创场景的纯国产推理集群在规划中。
多年高端 GPU 芯片级维修与运维积淀(lepaine.tech)
聚焦大模型 Token 解决方案,确立源头供应商定位
深圳IDC机房,NVIDIA高端算力集群规模化部署
开源旗舰模型规模化供给,开放 3 天不限量试用
华为昇腾、寒武纪适配启动,信创集群规划中
FAQ
技术买家最常问的几件事,我们直接写在官网上。
我们基于自有 NVIDIA 高端算力集群部署开源大模型 GLM-5.2 提供推理服务。GLM-5.2 由智谱 AI 依 MIT 开源协议发布,协议明确允许商业化使用,我方在许可范围内合法部署与供给,不存在合规风险。
不是。大模型普遍存在“幻觉”,对自身身份、训练来源等元信息的回答并不可靠,即使各官方平台的原厂模型也经常自称为其他模型,因此模型自述不能作为判断真实身份的依据。如需验证,我们可提供部署所用的模型版本与权重来源等信息,也欢迎通过公开基准复现、开源权重行为对比、盲测等客观方式验证。我们对服务真实性完全开放。
正式合作提供月度可用性不低于 99.9% 的 SLA,延迟指标同样写入合同;任一承诺未达标即以 Token 服务额度形式补偿(可用性区间对应当月消费额 5%-50%),自动计入次月账户。部署初期如遇偶发波动,试用群内工程师会第一时间定位处理。
接近于零。我们提供 OpenAI 兼容 API,替换 base_url 与 API Key 即可切换,支持流式输出、Function Call、思考模式、上下文缓存与结构化输出,1M 上下文、128K 最大输出。
提交客户类型(个人 / 企业 / API 中转站 / 云厂商 / 大模型厂商)、模型需求、业务场景与预估 TPM/RPM 后,1 个工作日内开通。自 Key 激活起 72 小时内 token 用量不设上限,可自由压测;到期自动失效、不产生费用。开通同时邀请进入专属试用群,技术问题随时反馈。
不会。请求与生成数据仅用于完成本次推理,严禁用于模型训练或提供给第三方,商务协议明确约定;传输全程 TLS 加密,可按需配置日志留存策略或零留存方案。
Start Now
不看 PPT,看压测。72 小时内 token 用量不设上限,专属群工程师全程值守,跑完你自己的 benchmark 再决定。