Google Gemini 3.8 Flash 低价反代账号池搭建教程
实测在海外日本 VPS 节点上 4.3 万次高强度生产调用,平均生成速度稳定在 550~800+ TPS,成功率 99.88%,Prompt 缓存命中率高达 95.1%。
以下是完整的搭建架构、避坑细节与开蹬指南。
1. 准备账号:批量成品号入场
构建账号池的核心是以极低成本获取稳定的 Google Pro 凭据:
成品号地址:
( 35 一个)
池子规模:一个号一周额度大概是 1B,但是因为有 5h 额度限制,所以需要多号负载均衡,基本 15 ~ 20 个号可以做到 token 自由。
发卡平台提供的账号已过风控验证,发货格式通常为:
1 | 用户名----密码----2FA密钥----Refresh Token |
关键避坑与风控细节:
只改 2FA,绝对不要改密码:新发货账号在异地修改密码极易触动 Google 风控。拿到密钥后,直接导入常用的 Authenticator(或在
查看验证码),保留原密码最稳。
无需逐个网页登录:卡密中已自带 Refresh Token,后续直接批量导入网关即可,省去繁琐的人工网页授权流程。部分账号 RT 失效,就手动在网页登录下。
2. 部署网关:一行命令都不用敲,全丢给 Agent
调度底座由两个成熟的开源项目组成:
核心代理后端:
Web 可视化面板:
服务器强烈推荐选用海外 VPS,日本东京机房(如软银、IIJ 或高质量 BGP 线路)是最佳选择,回国延迟极低且连 Google API 丝滑顺畅。
💡 防封提示:为了进一步防范 Google 对机房 IP 的风控标记,强烈推荐在 VPS 上配置 Cloudflare WARP 作为出口,让出站流量借由 WARP 原生 Anycast IP 转发,彻底混淆源站 IP。
配置反代和容器无需手动敲命令。连上你的海外 VPS,直接把下面这段 Prompt 复制甩给你的 Claude Code、Codex 或 Cursor,让 Agent 自动写配置并启动服务:
1 | 请帮我在当前海外 Linux 服务器上部署一套高可用 CPA(CLIProxyAPI + CPA-Manager-Plus + Caddy)AI 模型反代网关: |
Agent 会自动落盘配置文件、组装网络并拉起 Docker,几分钟搞定基础底座。
3. 账号导入与大盘监控
网关拉起后,注入账号凭据:
批量导入(主推)
让脚本或 Agent 读取买到的卡密列表,按以下格式批量生成 JSON,存放到服务器的 /opt/cpa/auths/ 目录下:
1 | { |
CLIProxyAPI 会自动载入并开始调度。
OAuth 手工补录(备用)
极少数账号如果 Refresh Token 失效,进入 CPA-Manager-Plus 面板的「OAuth 登录」,选择 Antigravity OAuth,点击「开始 Antigravity 登录」,按提示走网页授权即可完成补录:
凭据监控与额度大盘
在面板「凭证管理」中可以实时监控整个池子的健康度:
大盘会展示每个凭据的实时状态、请求频次、5 小时滑动额度条和 7 天使用配额。15~20 个号轮询起来,单号额度随用随回,池子几乎永远打不穿。
4. 双重防风控绝招:IP 出口混淆与零宽敏感词
要让 15~20 个账号长期高频并发不翻车,必须做好两层防御:
网络层:VPS 挂 Cloudflare WARP 混淆出口 IP
很多 VPS 服务商的机房 IP 段容易被 Google 标记。强烈建议在海外 VPS 上安装 Cloudflare WARP 作为出口网关。
通过将 VPS 的出站流量路由至 Cloudflare WARP 的 Anycast 优质原生 IP 池,能够有效掩盖真实服务器 IP,分散请求特征,彻底避开 Google 对特定数据中心 IP 段的关联风控与验证码拦截。
协议层:零宽字符混淆防伪 429 报错
高频调用 Claude Code 或 Agent SDK 时,请求中往往带有类似 “Claude Agent SDK” 的固定指纹。Google 后端会直接拦截该请求,并伪装成 429 Rate Limit 报错。
解决方法是在 CLIProxyAPI 的 config.yaml 中配置敏感词混淆:
1 | antigravity: |
开启后,网关转发前会自动插入不可见的零宽字符(Zero-width space),破除 Google 指纹拦截,同时完全不影响模型本身的语义理解,彻底根除假 429。
5. 客户端配置:Claude Code 开蹬
在本地终端配置别名,把 Claude Code 的各档模型全量映射到网关中拥有 100 万上下文的 gemini-3.8-flash-high[1m]:
1 | alias geminicc="CLAUDE_CODE_NO_FLICKER=1 \ |
关键参数拆解:
- CLAUDE_CODE_MAX_CONTEXT_TOKENS=1000000:解除默认 20 万 Token 限制,完全吃满 100 万上下文。
- ANTHROPIC_MODEL 与三档模型:统一映射到 gemini-3.8-flash-high[1m],兼顾深度思考与飞快响应。
- API_TIMEOUT_MS=3000000:调大单次超时到 50 分钟,应对复杂长代码任务。
- CLAUDE_CODE_EFFORT_LEVEL=max:开启满血推理思考深度。
6. 生产集群实测:真实硬核数据
这套打法的实际速度有多夸张?直接看我们在海外日本 VPS 节点上运行的真实生产网关数据库记录(共挂载 24 个账号):
可用性与请求规模
- 累计请求数:43,216 次
- 成功请求数:43,164 次
- 整体成功率:99.88%
- 429 报错次数:超 4.3 万次高强度请求中,仅出现 7 次 429。
延迟表现 (平均单次上下文输入高达 18.8 万 Tokens)
| 统计指标 | 首字延迟 (TTFT) | 端到端总延迟 (Latency) |
|---|---|---|
| 中位数 (P50) | 3.36 秒 | 4.45 秒 |
| 90 分位 (P90) | 7.79 秒 | 12.59 秒 |
| 95 分位 (P95) | 10.61 秒 | 19.52 秒 |
| 平均耗时 | 4.44 秒 | 6.89 秒 |
在长达近 20 万 Token 的代码库灌入下,3 秒多即可吐出首字。
炸裂的生成速度 (TPS - Tokens Per Second)
纯生成阶段(扣除首字网络与前置推理时间):
- 纯生成 TPS 中位数 (P50):168.5 tokens/s
- 纯生成 TPS 90 分位 (P90):1,023.8 tokens/s
- 纯生成平均 TPS:549.6 tokens/s(最近 24 小时平均达 788.5 tokens/s,最近 1 小时平均达 829.6 tokens/s)
- 纯生成峰值速度:突破 46,000+ tokens/s
上千行的代码生成往往几秒内刷完,没有任何等待模型慢吞吞吐字的卡顿感。
81 亿 Token 吞吐与跨账号缓存
- 累计消耗总 Tokens:81.69 亿
- 输入 Tokens:81.45 亿
- 输出与思考 Tokens:2,450 万
- Prompt Cache 读取量:77.46 亿
- 全局缓存命中率:95.1%
Google 基础设施支持跨账号隐式前缀缓存,超过 95% 的上下文被瞬间命中,大幅降低传输损耗,也是首字延迟能够压在 3 秒级的核心关键。
7. 总结
几十块钱的账号成本 + 几分钟的 Agent 自动化部署,换来一整套工业级可用、不限并发、秒吐千字、自带 1M 上下文的模型池。重度使用 AI 编程的朋友,尽早搭一套。









