Hinweis: Dieser Dienst wird ausschließlich zu experimentellen Zwecken bereitgestellt und „wie besehen“ angeboten. Wir haben keinen Einfluss auf sein Verhalten und übernehmen keine Haftung dafür.
Leistung und Verfügbarkeit werden nicht garantiert, insbesondere in Zeiten hoher Auslastung. Es werden keine Backups erstellt, daher bist du selbst für die Sicherung deiner Konfigurationen verantwortlich und solltest die Plattform nicht für Produktionsumgebungen nutzen.
Die Inference-API bietet über eine OpenAI-kompatible REST-API Zugriff auf Open-Source-Großsprachenmodelle. Derzeit werden drei Standard-Endpunkte bereitgestellt: /v1/models, /v1/completions und /v1/chat/completions. Du kannst sie mit jedem OpenAI-kompatiblen SDK nutzen oder manuell Anfragen mit einem HTTP-Client erstellen.
Base-URL: https://inference.hetzner.com/api/v1
Verfügbare Modelle
Es sind nur ausgewählte Modelle sind verfügbar. Du kannst die Liste der aktuell verfügbaren Modelle jederzeit über den Endpunkt /v1/models abfragen. Die Antwort des Models-Endpunkts ist entscheidend.
curl -s https://inference.hetzner.com/api/v1/models \
-H "Authorization: Bearer <YOUR_TOKEN>"| Modell | Typ | Kontextlänge | Modalitäten |
|---|---|---|---|
| Qwen/Qwen3.6-35B-A3B-FP8 | Kausales Sprachmodell + Bildverarbeitung (MoE, insgesamt 35 Mrd. / 3 Mrd. aktiv) | 262.144 Token | Text, Bild |
| Qwen3.8-27B | Dense | 262.144 Token | Text, Bild |
Python-Beispiele für OpenAI
Alle Beispiele verwenden das OpenAI-Python-SDK. Installiere es mit:
pip install openaiInitialisiere den Client:
from openai import OpenAI
client = OpenAI(
base_url="https://inference.hetzner.com/api/v1",
api_key="<YOUR_TOKEN>",
)Chat-Vervollständigungen
Sende eine Unterhaltung und erhalte eine vom Modell generierte Antwort.
response = client.chat.completions.create(
model="Qwen/Qwen3.6-35B-A3B-FP8",
messages=[
{"role": "system", "content": "Du bist ein hilfsbereiter Assistent."},
{"role": "user", "content": "Bitte gib mir eine ganz kurze Beschreibung der Hetzner-Dienste!"},
]
)
print(response.choices[0].message.content)Bildverarbeitung
Sende zusammen mit deiner Eingabe eine Bild-URL, um die Bildverarbeitungsfunktionen des Modells zu nutzen.
response = client.chat.completions.create(
model="Qwen/Qwen3.6-35B-A3B-FP8",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Beschreibe dieses Bild ausführlich."},
{
"type": "image_url",
"image_url": {"url": "https://cdn.hetzner.de/cdn/public/Uploads/Finnland_Luftaufnahme-v2.jpg"},
},
],
}
],
)
print(response.choices[0].message.content)Curl-Beispiele
Chat-Vervollständigung
curl -s https://inference.hetzner.com/api/v1/chat/completions \
-H "Authorization: Bearer <YOUR_TOKEN>" \
-H "Content-Type: application/json" \
-d '{
"model": "Qwen/Qwen3.6-35B-A3B-FP8",
"messages": [
{"role": "system", "content": "Du bist ein hilfsbereiter Assistent."},
{"role": "user", "content": "Wie lauten die drei Gesetze der Thermodynamik?"}
]
}'Bildverarbeitung
curl -s https://inference.hetzner.com/api/v1/chat/completions \
-H "Authorization: Bearer <DEIN_TOKEN>" \
-H "Content-Type: application/json" \
-d '{
"model": "Qwen/Qwen3.6-35B-A3B-FP8",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "Beschreibe dieses Bild ausführlich."},
{
"type": "image_url",
"image_url": {"url": "https://cdn.hetzner.de/cdn/public/Uploads/Finnland_Luftaufnahme-v2.jpg"}
}
]
}
]
}'FAQ
Kann ich die Inference API kostenlos nutzen?
Solange sich die Inference API im experimentellen Status befindet, ist sie kostenlos. Sollte sich dieser Status ändern, informieren wir dich vorab per E-Mail mit ausführlichen Informationen.
Welche Informationen werden gespeichert?
Wir speichern ausschließlich Daten, die erforderlich sind, um die Nutzung nachzuverfolgen und die Nutzung (zukünftig) abzurechnen: Zeitstempel der Anfragen, Token-Anzahl usw.
Wir speichern weder den Inhalt von Anfragen noch den von Antworten und haben nicht vor das in Zukunft zu ändern (außer ein Gesetz verpflichtet uns dazu). Unser Ziel ist es ausschließlich unsere Rechenzentren und Hardware zu verwenden, um Kunden einen kostengünstigen Zugang zu Open-Weight-Modellen zu ermöglichen.
Welche Limits gelten?
Die API wendet Ratenlimits an, um eine faire Nutzung und die Stabilität des Dienstes zu gewährleisten. Die aktuellen Limits gelten pro API-Schlüssel:
| Zeitraum | Eingabe-Token | Ausgabe-Token |
|---|---|---|
| 60 s | 4 Mio. | 100.000 |
Zusätzlich gelten folgende folgende Rate-Limits auf Anfrageebene:
| Zeitraum | Anfragen |
|---|---|
| 60s | 10 |
Wenn du eine der Ratenbeschränkungen überschreitest, antwortet die API mit dem HTTP-Statuscode 429.
Warum gibt es nur eine begrenzte Anzahl an Modellen?
Die Inference-API befindet sich derzeit im experimentellen Status. Wir beginnen mit einer Auswahl an hochwertigen Modellen, um die Plattform zu validieren, Feedback zu sammeln und die Zuverlässigkeit sicherzustellen.
Weitere Modelle werden je nach Nachfrage und Betriebserfahrung hinzugefügt.
Wie kann ich Feedback geben?
Wir freuen uns über deine Rückmeldung! Bitte schreibe uns hier. Egal, ob es sich um einen Fehlerbericht, einen Feature-Wunsch oder allgemeine Eindrücke handelt.
Open-Source-Modelllizenzen & Namensnennung
Die über diese API verfügbaren Modelle sind Open Source und unterliegen ihren jeweiligen Lizenzen. Durch die Nutzung dieser API erkennst du die geltenden Lizenzbedingungen der zugrunde liegenden Modelle an.
| Modell | Entwickler | Lizenz | Quelle |
|---|---|---|---|
| Qwen3.6-35B-A3B | Alibaba Cloud (Qwen-Team) | Apache 2.0 | Hugging Face |
| Qwen3.8-27B | Alibaba Cloud (Qwen-Team) | Apache 2.0 | Hugging Face |
Alle Modelle werden von ihren jeweiligen Entwicklern „wie besehen“ bereitgestellt, ohne jegliche Gewährleistung. Die vollständigen Bedingungen findest du in der Lizenz des jeweiligen Modells.