ClaudeMap

kaggle-tpu-lab

在 Kaggle 免费 TPU v5e-8 上跑 Qwen3.8-27B,暴露 OpenAI 兼容端点,可直接接进 Claude Code、Codex CLI 或 opencode。

SDK 与工具self-hostingopenai-compatibletpuqwenfree-tier

kaggle-tpu-lab 是把一个前沿级 27B 混合注意力模型跑在 Kaggle 免费 TPU 档上的完整配方:完整 bf16 权重不做量化、支持模型原生 262,144 token 上下文、暴露 OpenAI 兼容端点。它建立在 vllm-tpu 0.28.0 为 gated-DeltaNet 线性注意力提供的 Pallas 内核之上——正是这种架构的极小 KV 缓存让 27B 能塞进 8×16 GB 的 TPU 芯片。

它做什么

  • OpenAI 兼容端点可作 Claude Code / Codex CLI / opencode 的后端——仓库自测:MTP 投机解码下单流 ~130 tok/s(关闭时 78)
  • bf16、TP=8 下原生 262,144 token 上下文——22.5 万 token 提示词约 28 秒完成 prefill(仓库自测)
  • 挂上数据集后约 22 分钟拿到可用端点(--text-only 约 12 分钟、--fast-start 约 6 分钟)
  • 既可以 Copy & Edit 官方发布的 Kaggle notebook,也可以用 CLI 推送并启动:python launch.py serve

什么时候用

适合想要免费、长上下文、OpenAI 兼容后端的开发者——不用开云账户、不烧 GPU 预算:做实验、压测 agent 工作流,或体验多数托管服务给不到的 262k 上下文窗口。

如何上手

# 需要开通 TPU 的 Kaggle 账号(手机验证;免费档约 20 TPU 小时/周)
pip install kaggle
# kaggle.com → Settings → API → Create New Token → 放到 ~/.kaggle/kaggle.json

git clone https://github.com/ARahim3/kaggle-tpu-lab
cd kaggle-tpu-lab
python launch.py serve
# 就绪后端点 URL 与 API key 会流式打到终端

注意事项

吞吐与延迟数字均为仓库作者自测,不是可依赖的服务承诺。Kaggle 免费档要排队等 TPU、需手机验证、每周约 20 TPU 小时——会话是临时的,端点只适合实验,不能当生产。

代码仓库

ARahim3/kaggle-tpu-lab

收录日期

地图上的相关资源

  • Harness Bridge

    SDK / 工具

    一个本地启动器:让 Claude Code 与其他七种编码 harness 直连任意 OpenAI / Anthropic / Responses 兼容端点——不改任何一行配置文件。

    • launcher
    • local-models
    • cli
    • menu-bar
  • Claude for Siri

    SDK / 工具

    用你已登录的 Claude Code 账号回答 macOS Spotlight 与 Siri 的提问——一个实验性的 macOS 27 模型委派提供者。

    • macos
    • siri
    • spotlight
    • model-delegation
  • 把十个 AI 编程助手的本地聊天记录提取成统一 JSONL——微调、分析,或赶在本地数据库被清空前备份多年的对话。纯标准库实现。

    • cli
    • data-export
    • jsonl
    • backup