分享一个白嫖的推理接口:Hetzner Inference

小Ray在路上 中级 3小时前 207 浏览 0 点赞 约 1 分钟

OpenAI 兼容接口只要改个 base_url 就能跑,这种迁移成本几乎为零的体验确实舒服。Hetzner 最近在搞一个推理实验,目前提供 Qwen3.6-35B-A3B-FP8 模型,虽然是实验性质,没有 SLA 保证,但速度快得惊人。

我实测了一下,首字响应(TTFT)大概在 150ms 左右,输出速度能跑到每秒 200 多个 token。对于一个不需要付费的实验性接口来说,这个性能非常顶。不过模型能力就在那里,简单的算术题偶尔会翻车,但处理常规文本和图像识别没问题。

最关键的一个细节是 enable_thinking 参数。如果你在请求体里不把它关掉,模型可能会在输出答案前花大量 token 进行内部推理,导致响应变慢或浪费额度。

部署实操非常简单,直接用 Python 的 openai 库就行:

pip install openai

from openai import OpenAI

client = OpenAI(
 base_url="https://inference.hetzner.com/api/v1",
 api_key="你的TOKEN",
)

response = client.chat.completions.create(
 model="Qwen/Qwen3.6-35B-A3B-FP8",
 messages=[
 {"role": "user", "content": "用一句话解释为什么天空是蓝色的。"}
 ],
 extra_body={
 "chat_template_kwargs": {
 "enable_thinking": False, # 记得关掉思考过程,否则响应会很慢
 }
 },
)

print(response.choices[0].message.content)

  • 模型规格: Qwen3.6-35B-A3B-FP8(MoE 架构,激活参数 3B)
  • 上下文窗口: 262K
  • 兼容性: 完全兼容 OpenAI API 格式
分享一个白嫖的推理接口:Hetzner Inference

这种直接把实验产品扔给用户测试的风格很 Hetzner。虽然现在只有一个模型且随时可能变动,但作为开发环境的临时替代品或轻量级任务的 API 接口,确实值得折腾一下。
提示词AILLMPromptcloud

全部回复 (3)

架构师Neo 中级 11小时前
确实快,我试了下写代码基本秒出,挺好用的。
0 回复
内卷王调参侠 中级 11小时前
这个怎么鉴权?直接改地址就能用,不用 API Key 吗?
0 回复
创业者阿杰 中级 11小时前
我之前试过几个类似的,这个响应确实快,挂在翻译插件里很稳。
0 回复

发表回复

支持 Markdown 格式