价格与真实性
价格为什么能低于厂商原价、低到什么程度,以及一条通道凭什么被认为在卖它声称的那个模型。
两个问题——价格为什么比厂商原价低,以及凭什么认为你拿到的是标签上那个模型。两者都从同一件事出发:这些 token 是谁的。
token 是谁的
不是我们的。Asale 不跑任何模型,也不持有任何额度。
每个请求都由某个真实用户的上游账号完成:他自己的 Claude Pro / Max、ChatGPT / Codex、Gemini、Kimi、Grok 订阅,或他自己的 API key。请求经他的机器发到服务商,回来的 token 是那个账号真实消耗的。平台只做撮合、计量和结算。
后面两节都从这一点长出来:
- 价格能低于原价,因为那份额度的持有者已经付过钱了,用不完的部分对他边际成本为零。
- 真实性需要被检查,因为「请求真的被转发给了标称的模型」协议本身证明不了——中间那台机器不是我们的。
价格
订阅按周期付费,用不用都一样。Claude Max 每五小时重置,窗口里没花掉的不会累积。注定用不到的额度边际成本为零,低于原价卖出仍是净收入。这就是折扣的全部来源,没有补贴,也没人在亏本卖。
折扣不是固定的。每个模型带一个比例——此刻卖到厂商原价的百分之几,每分钟按买家对在线通道的压迫程度重算:
市场价 = 原价 × 比例 比例 ∈ [0.10, 1.00]
卖家多于买家时比例往 10% 走;反过来会被推回去,必要时一路到原价,直到报价更高的卖家愿意进场。所以「低至一折」是区间下端,不是常态价——做计划前先看市场页。
平台从每笔成交抽 8%,其余归实际提供服务的那台设备。算法与算例见模型如何定价。
为什么便宜的 token 常常不是它说的那个模型
任何人都可以声明自己在卖 claude-opus-5。连接是通的,usage 能解析,通道也确实出现在市场上。协议里没有任何东西能证明那些 token 来自标签上的模型。
把请求转给价格只有百分之一的模型,常规检查一条都不会触发。这个价差就是套利空间。常见三种做法:
- 用中档模型或量化镜像,顶着旗舰的名字应答;
- 把让贵模型之所以贵的参数剥掉——思考预算、工具 schema、缓存断点;
- 回程把 token 数报高,同一个答案收更多钱。
三种都不会在响应里留下明显痕迹。一段短回复看上去就是一段短回复。
上市前:先卖给平台
远程证明没法确认一台陌生机器上跑的是哪个二进制。可以做的是比对行为:提一些答案取决于生成它的模型本身的问题,看回答像不像它声称的那个模型。
一条通道是 (设备, 服务商, 模型) 三元组,各自独立验证;便宜模型上拿到的判决不会给贵模型背书。
- 平台从正门买十来次
同一个网关、同一种派单帧、和买家请求完全相同的路径,只是被钉在这一台设备上。整轮两侧都按零结算:不扣买家的钱,也不给卖家结钱。它会消耗卖家自己的订阅额度。
- 打分,写下判决
分数 ≥ 75 且没有硬闸门命中为
pass。结论不明确或分数偏低但没有硬证据为watch——仍然可以卖,只是抽检率提高十倍、排序下降。只有命中硬闸门且估计器置信度不低于 0.6 才是reject,该通道下架。 - 通过之前买家看不到
未验证的通道不会被匹配给任何买家。这不是「上线慢」:离开这个状态的唯一途径是平台先从它这里买一次。
一次不明确的运行不作为欺诈证据。一个在两次运行之间能跳一整档的统计量,拿来把卖家赶出市场是不合适的。
上市后:抽检
预告过的考试是可以临时应付的。所以已验证的通道会在它无法预测的时刻被重新探测,走同一个正门,外层与任何一次购买完全一样:
| 已验证通道被抽检的流量占比 | 1% |
处于 watch、或所属账号出过拒绝判决时 | 10% |
| 在售通道两次抽检的最长间隔(无论流量多少) | 72 小时 |
| 一个通过判决的有效期 | 7 天 |
时间上限和百分比一样重要:没有它,一条没有买家的通道就永远不会被检查,而「让自己在两次抽检之间没有买家」是可以安排的。
抽检按市价付钱给卖家。这不是慷慨——不付钱的抽检会在收益流水里留下缺口,缺口就是作弊者可以盯的标记。一次抽检还会摊开到将近一小时,而不是连着打一梭子:二十一个请求按固定顺序连发是一种形状,形状可以被认出来。
和同类通道比
市场能同时看到很多条在卖同一模型的通道,所以问题不必是抽象的「这是不是 Opus」,而可以是「这条通道的表现和其他 Opus 通道一样吗」——更容易,也更稳定。
只跟踪能穿过中继依然成立的数字:写多长、开始生成后多快、各难度档的正确率。不涉及提示内容,也不含能指认卖家的信息。一个模型至少要有八条通道,群体画像才算数。偏离三个标准差以上的通道会被安排更深的复检,而不是被拒绝——某个模型的第一个卖家、某地区唯一的卖家,都是离群点,但不是骗子。
题目为什么不公开
验证引擎 llm-verify 是开源的,任何人都可以审查它问了什么。这同时是它的天花板:被探测的卖家也能读到这套题,于是老实答这些题,把其余流量转走。
所以真正决定判决的评分题,按每次运行的服务端种子现场生成:多步推导、答案唯一且可校验,本地算出而非查表。种子写进报告,有争议的判决可以逐题复现。
题目刻意不是常识问答——常识问答测的是训练语料,语料大的便宜模型也能过。要抓的不是把噪声当 Opus 卖(那在第一道身份探测就露馅),而是把中档模型或量化镜像当旗舰卖,这两者都答得对「你是谁做的」。区分它们的是最难那一档的正确率。
计费
价格以上游服务商上报的 usage 为准。围绕它:
- 网关独立数一遍同一个请求,两个数放在一起比。自报数持续偏离的通道按计量问题处理,与真实性分开追踪。
- 四类 token 分开计价:输入、输出、缓存读取、缓存写入。缓存读取约为全新输入的十分之一,长的 agent 会话绝大部分是缓存读取。
- 一次会话十分钟内固定到同一个卖家,因为缓存只对写下它的那个上游账号有效。
- 请求出错、用量返回为零、你中途断开、卖家在发出第一个字节前掉线,都不计费。预授权冻结按
max_tokens算,不是扣款,没用掉的原路退回。
这套做法解决不了什么
- **没有办法证明远端跑的是哪个二进制。**以上全是行为层面的推断,不是密码学证明。
- **验证是抽样。**已验证通道 1% 的流量被检查,不是每个请求。两次抽检之间作弊,会在下一次被抓到,而不是当场。
- **
watch判决仍然在卖。**结论不明确的通道不会下架,只是检查更频繁、排序下降。 - **供给薄的时候这里不便宜。**比例会一路回到原价。它是实时数字,不是承诺。
- **不是端到端加密。**你的请求经由另一个用户的客户端转发,对方能看到内容。见安全。
验证引擎与 token 计量是两个独立的 Apache-2.0 crate,发布在 crates.io 上,就是这里跑的那份代码。你可以拿去对任何端点跑,包括我们的。