实测在海外日本 VPS 节点上 4.3 万次高强度生产调用,平均生成速度稳定在 550~800+ TPS,成功率 99.88%,Prompt 缓存命中率高达 95.1%

以下是完整的搭建架构、避坑细节与开蹬指南。

1. 准备账号:批量成品号入场

构建账号池的核心是以极低成本获取稳定的 Google Pro 凭据:

  • 成品号地址

    https://wzyp.cn/item/bu7mcn

    ( 35 一个)

  • 池子规模:一个号一周额度大概是 1B,但是因为有 5h 额度限制,所以需要多号负载均衡,基本 15 ~ 20 个号可以做到 token 自由。

发卡平台提供的账号已过风控验证,发货格式通常为:

1
用户名----密码----2FA密钥----Refresh Token

关键避坑与风控细节

  • 只改 2FA,绝对不要改密码:新发货账号在异地修改密码极易触动 Google 风控。拿到密钥后,直接导入常用的 Authenticator(或在

    2fa.show

    查看验证码),保留原密码最稳。

  • 无需逐个网页登录:卡密中已自带 Refresh Token,后续直接批量导入网关即可,省去繁琐的人工网页授权流程。部分账号 RT 失效,就手动在网页登录下。

2. 部署网关:一行命令都不用敲,全丢给 Agent

调度底座由两个成熟的开源项目组成:

服务器强烈推荐选用海外 VPS,日本东京机房(如软银、IIJ 或高质量 BGP 线路)是最佳选择,回国延迟极低且连 Google API 丝滑顺畅。

💡 防封提示:为了进一步防范 Google 对机房 IP 的风控标记,强烈推荐在 VPS 上配置 Cloudflare WARP 作为出口,让出站流量借由 WARP 原生 Anycast IP 转发,彻底混淆源站 IP。

配置反代和容器无需手动敲命令。连上你的海外 VPS,直接把下面这段 Prompt 复制甩给你的 Claude Code、Codex 或 Cursor,让 Agent 自动写配置并启动服务:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
请帮我在当前海外 Linux 服务器上部署一套高可用 CPA(CLIProxyAPI + CPA-Manager-Plus + Caddy)AI 模型反代网关:

1. 核心镜像:
- CLIProxyAPI 使用官方镜像 eceasy/cli-proxy-api:latest(内部监听 8317 端口)。
- 面板使用 seakee/cpa-manager-plus:latest(内部监听 18317 端口)。
- 反向代理使用 caddy:2-alpine 统一管理 80/443 端口与 HTTPS 证书。

2. 目录结构与持久化:
- 请在 /opt/cpa/ 下创建 docker-compose.yml、config.yaml、Caddyfile。
- 挂载凭据目录 ./auths:/root/.cli-proxy-api、数据目录 ./cpa-data:/data。
- 在 docker-compose 中为 cpa-manager-plus 注入固定的 CPA_MANAGEMENT_KEY 和 CPA_UPSTREAM_URL: http://cli-proxy-api:8317,保证即使统计库重置也能自动建立面板与网关的双向绑定。

3. 路由设计:
- Caddy 将 /v1/*、/openai/*、/anthropic/*、/gemini/* 路由代理至 CLIProxyAPI 容器(关闭这部分接口的 Gzip/Zstd 压缩以保证流式低延迟)。
- 将其余后台管理路径(如 /management.html、/api/*)反代至 CPA Manager Plus。

4. 启动与验证:
- 执行 docker compose up -d 启动全部容器。
- 检查容器健康状态,确保各端口绑定正确、服务存活。

Agent 会自动落盘配置文件、组装网络并拉起 Docker,几分钟搞定基础底座。

3. 账号导入与大盘监控

网关拉起后,注入账号凭据:

批量导入(主推)

让脚本或 Agent 读取买到的卡密列表,按以下格式批量生成 JSON,存放到服务器的 /opt/cpa/auths/ 目录下:

1
2
3
4
5
6
{
"type": "antigravity",
"email": "example@gmail.com",
"refresh_token": "1//04xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx",
"disabled": false
}

CLIProxyAPI 会自动载入并开始调度。

OAuth 手工补录(备用)

极少数账号如果 Refresh Token 失效,进入 CPA-Manager-Plus 面板的「OAuth 登录」,选择 Antigravity OAuth,点击「开始 Antigravity 登录」,按提示走网页授权即可完成补录:

凭据监控与额度大盘

在面板「凭证管理」中可以实时监控整个池子的健康度:

大盘会展示每个凭据的实时状态、请求频次、5 小时滑动额度条和 7 天使用配额。15~20 个号轮询起来,单号额度随用随回,池子几乎永远打不穿。

4. 双重防风控绝招:IP 出口混淆与零宽敏感词

要让 15~20 个账号长期高频并发不翻车,必须做好两层防御:

网络层:VPS 挂 Cloudflare WARP 混淆出口 IP

很多 VPS 服务商的机房 IP 段容易被 Google 标记。强烈建议在海外 VPS 上安装 Cloudflare WARP 作为出口网关

通过将 VPS 的出站流量路由至 Cloudflare WARP 的 Anycast 优质原生 IP 池,能够有效掩盖真实服务器 IP,分散请求特征,彻底避开 Google 对特定数据中心 IP 段的关联风控与验证码拦截。

协议层:零宽字符混淆防伪 429 报错

高频调用 Claude Code 或 Agent SDK 时,请求中往往带有类似 “Claude Agent SDK” 的固定指纹。Google 后端会直接拦截该请求,并伪装成 429 Rate Limit 报错。

解决方法是在 CLIProxyAPI 的 config.yaml 中配置敏感词混淆:

1
2
3
antigravity:
sensitive-words:
- "Claude Agent SDK"

开启后,网关转发前会自动插入不可见的零宽字符(Zero-width space),破除 Google 指纹拦截,同时完全不影响模型本身的语义理解,彻底根除假 429。

5. 客户端配置:Claude Code 开蹬

在本地终端配置别名,把 Claude Code 的各档模型全量映射到网关中拥有 100 万上下文的 gemini-3.8-flash-high[1m]:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
alias geminicc="CLAUDE_CODE_NO_FLICKER=1 \
CLAUDE_CODE_MAX_CONTEXT_TOKENS=1000000 \
CLAUDE_CODE_AUTO_COMPACT_WINDOW=1000000 \
ANTHROPIC_BASE_URL={你的 网关 URL} \
ANTHROPIC_AUTH_TOKEN={你的 API-KEY} \
API_TIMEOUT_MS=3000000 \
CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1 \
ANTHROPIC_MODEL=gemini-3.8-flash-high[1m] \
ANTHROPIC_DEFAULT_OPUS_MODEL=gemini-3.8-flash-high[1m] \
ANTHROPIC_DEFAULT_SONNET_MODEL=gemini-3.8-flash-high[1m] \
ANTHROPIC_DEFAULT_HAIKU_MODEL=gemini-3.8-flash-high[1m] \
CLAUDE_CODE_SUBAGENT_MODEL=gemini-3.8-flash-high[1m] \
CLAUDE_CODE_EFFORT_LEVEL=max \
claude --teammate-mode in-process --dangerously-skip-permissions"

关键参数拆解

  • CLAUDE_CODE_MAX_CONTEXT_TOKENS=1000000:解除默认 20 万 Token 限制,完全吃满 100 万上下文。
  • ANTHROPIC_MODEL 与三档模型:统一映射到 gemini-3.8-flash-high[1m],兼顾深度思考与飞快响应。
  • API_TIMEOUT_MS=3000000:调大单次超时到 50 分钟,应对复杂长代码任务。
  • CLAUDE_CODE_EFFORT_LEVEL=max:开启满血推理思考深度。

6. 生产集群实测:真实硬核数据

这套打法的实际速度有多夸张?直接看我们在海外日本 VPS 节点上运行的真实生产网关数据库记录(共挂载 24 个账号):

可用性与请求规模

  • 累计请求数43,216 次
  • 成功请求数:43,164 次
  • 整体成功率99.88%
  • 429 报错次数:超 4.3 万次高强度请求中,仅出现 7 次 429

延迟表现 (平均单次上下文输入高达 18.8 万 Tokens)

统计指标 首字延迟 (TTFT) 端到端总延迟 (Latency)
中位数 (P50) 3.36 秒 4.45 秒
90 分位 (P90) 7.79 秒 12.59 秒
95 分位 (P95) 10.61 秒 19.52 秒
平均耗时 4.44 秒 6.89 秒

在长达近 20 万 Token 的代码库灌入下,3 秒多即可吐出首字。

炸裂的生成速度 (TPS - Tokens Per Second)

纯生成阶段(扣除首字网络与前置推理时间):

  • 纯生成 TPS 中位数 (P50)168.5 tokens/s
  • 纯生成 TPS 90 分位 (P90)1,023.8 tokens/s
  • 纯生成平均 TPS549.6 tokens/s(最近 24 小时平均达 788.5 tokens/s,最近 1 小时平均达 829.6 tokens/s
  • 纯生成峰值速度:突破 46,000+ tokens/s

上千行的代码生成往往几秒内刷完,没有任何等待模型慢吞吞吐字的卡顿感。

81 亿 Token 吞吐与跨账号缓存

  • 累计消耗总 Tokens81.69 亿
  • 输入 Tokens:81.45 亿
  • 输出与思考 Tokens:2,450 万
  • Prompt Cache 读取量77.46 亿
  • 全局缓存命中率95.1%

Google 基础设施支持跨账号隐式前缀缓存,超过 95% 的上下文被瞬间命中,大幅降低传输损耗,也是首字延迟能够压在 3 秒级的核心关键。

7. 总结

几十块钱的账号成本 + 几分钟的 Agent 自动化部署,换来一整套工业级可用、不限并发、秒吐千字、自带 1M 上下文的模型池。重度使用 AI 编程的朋友,尽早搭一套。