Inference API

Last change on 2026-07-24 • Created on 2026-07-24 • ID: GE-A8173

Hinweis: Dieser Dienst wird ausschließlich zu experimentellen Zwecken bereitgestellt und „wie besehen“ angeboten. Wir haben keinen Einfluss auf sein Verhalten und übernehmen keine Haftung dafür.
Leistung und Verfügbarkeit werden nicht garantiert, insbesondere in Zeiten hoher Auslastung. Es werden keine Backups erstellt, daher bist du selbst für die Sicherung deiner Konfigurationen verantwortlich und solltest die Plattform nicht für Produktionsumgebungen nutzen.

Die Inference-API bietet über eine OpenAI-kompatible REST-API Zugriff auf Open-Source-Großsprachenmodelle. Derzeit werden drei Standard-Endpunkte bereitgestellt: /v1/models, /v1/completions und /v1/chat/completions. Du kannst sie mit jedem OpenAI-kompatiblen SDK nutzen oder manuell Anfragen mit einem HTTP-Client erstellen.

Base-URL: https://inference.hetzner.com/api/v1

Verfügbare Modelle

Es sind nur ausgewählte Modelle sind verfügbar. Du kannst die Liste der aktuell verfügbaren Modelle jederzeit über den Endpunkt /v1/models abfragen. Die Antwort des Models-Endpunkts ist entscheidend.

curl -s https://inference.hetzner.com/api/v1/models \
  -H "Authorization: Bearer <YOUR_TOKEN>"
Modell Typ Kontextlänge Modalitäten
Qwen/Qwen3.6-35B-A3B-FP8 Kausales Sprachmodell + Bildverarbeitung (MoE, insgesamt 35 Mrd. / 3 Mrd. aktiv) 262.144 Token Text, Bild
Qwen3.8-27B Dense 262.144 Token Text, Bild

Python-Beispiele für OpenAI

Alle Beispiele verwenden das OpenAI-Python-SDK. Installiere es mit:

pip install openai

Initialisiere den Client:

from openai import OpenAI
client = OpenAI(
    base_url="https://inference.hetzner.com/api/v1",
    api_key="<YOUR_TOKEN>",
)

Chat-Vervollständigungen

Sende eine Unterhaltung und erhalte eine vom Modell generierte Antwort.

response = client.chat.completions.create(
    model="Qwen/Qwen3.6-35B-A3B-FP8",
    
messages=[
        {"role": "system", "content": "Du bist ein hilfsbereiter Assistent."},
        {"role": "user", "content": "Bitte gib mir eine ganz kurze Beschreibung der Hetzner-Dienste!"},
    ]
)
print(response.choices[0].message.content)

Bildverarbeitung

Sende zusammen mit deiner Eingabe eine Bild-URL, um die Bildverarbeitungsfunktionen des Modells zu nutzen.

response = client.chat.completions.create(
    model="Qwen/Qwen3.6-35B-A3B-FP8",
    
messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "Beschreibe dieses Bild ausführlich."},
                
{
                    "type": "image_url",
                    "image_url": {"url": "https://cdn.hetzner.de/cdn/public/Uploads/Finnland_Luftaufnahme-v2.jpg"},
                },
            ],
        }
    ],
)
print(response.choices[0].message.content)

Curl-Beispiele

Chat-Vervollständigung

curl -s https://inference.hetzner.com/api/v1/chat/completions \
  -H "Authorization: Bearer <YOUR_TOKEN>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen3.6-35B-A3B-FP8",
    "messages": [
      {"role": "system", "content": "Du bist ein hilfsbereiter Assistent."},
      {"role": "user", "content": "Wie lauten die drei Gesetze der Thermodynamik?"}
    ]
  }'

Bildverarbeitung

curl -s https://inference.hetzner.com/api/v1/chat/completions \
  -H "Authorization: Bearer <DEIN_TOKEN>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen3.6-35B-A3B-FP8",
    "messages": [
      {
        "role": "user",
        "content": [
          {"type": "text", "text": "Beschreibe dieses Bild ausführlich."},
          {
            "type": "image_url",
            "image_url": {"url": "https://cdn.hetzner.de/cdn/public/Uploads/Finnland_Luftaufnahme-v2.jpg"}
          }
        ]
      }
    ]
  }'

FAQ

Kann ich die Inference API kostenlos nutzen?

Solange sich die Inference API im experimentellen Status befindet, ist sie kostenlos. Sollte sich dieser Status ändern, informieren wir dich vorab per E-Mail mit ausführlichen Informationen.

Welche Informationen werden gespeichert?

Wir speichern ausschließlich Daten, die erforderlich sind, um die Nutzung nachzuverfolgen und die Nutzung (zukünftig) abzurechnen: Zeitstempel der Anfragen, Token-Anzahl usw.

Wir speichern weder den Inhalt von Anfragen noch den von Antworten und haben nicht vor das in Zukunft zu ändern (außer ein Gesetz verpflichtet uns dazu). Unser Ziel ist es ausschließlich unsere Rechenzentren und Hardware zu verwenden, um Kunden einen kostengünstigen Zugang zu Open-Weight-Modellen zu ermöglichen.

Welche Limits gelten?

Die API wendet Ratenlimits an, um eine faire Nutzung und die Stabilität des Dienstes zu gewährleisten. Die aktuellen Limits gelten pro API-Schlüssel:

Zeitraum Eingabe-Token Ausgabe-Token
60 s 4 Mio. 100.000

Zusätzlich gelten folgende folgende Rate-Limits auf Anfrageebene:

Zeitraum Anfragen
60s 10

Wenn du eine der Ratenbeschränkungen überschreitest, antwortet die API mit dem HTTP-Statuscode 429.

Warum gibt es nur eine begrenzte Anzahl an Modellen?

Die Inference-API befindet sich derzeit im experimentellen Status. Wir beginnen mit einer Auswahl an hochwertigen Modellen, um die Plattform zu validieren, Feedback zu sammeln und die Zuverlässigkeit sicherzustellen.
Weitere Modelle werden je nach Nachfrage und Betriebserfahrung hinzugefügt.

Wie kann ich Feedback geben?

Wir freuen uns über deine Rückmeldung! Bitte schreibe uns hier. Egal, ob es sich um einen Fehlerbericht, einen Feature-Wunsch oder allgemeine Eindrücke handelt.

Open-Source-Modelllizenzen & Namensnennung

Die über diese API verfügbaren Modelle sind Open Source und unterliegen ihren jeweiligen Lizenzen. Durch die Nutzung dieser API erkennst du die geltenden Lizenzbedingungen der zugrunde liegenden Modelle an.

Modell Entwickler Lizenz Quelle
Qwen3.6-35B-A3B Alibaba Cloud (Qwen-Team) Apache 2.0 Hugging Face
Qwen3.8-27B Alibaba Cloud (Qwen-Team) Apache 2.0 Hugging Face

Alle Modelle werden von ihren jeweiligen Entwicklern „wie besehen“ bereitgestellt, ohne jegliche Gewährleistung. Die vollständigen Bedingungen findest du in der Lizenz des jeweiligen Modells.

Table of Contents