Serverless Inference API
für Open-Weight-Modelle

OpenAI-kompatible API. Mit einer Zeile Code konfigurieren. Abrechnung pro Token.
Hauptsitz in Deutschland. ISO 27001-zertifiziert.

Serverless Inference

Open-Weight-Modelle, produktiv im Einsatz

Die Open-Weight-Modelle, mit denen Teams tatsächlich in Produktion gehen, auf einem Endpunkt, abgerechnet pro Million Tokens.
Early Access jetzt offen für ausgewählte Design-Partner und AI Labs.

Serverless Inference
Ein Endpunkt für die führenden Open-Weight-Modelle. Wir betreiben den Serving-Stack, Sie senden Anfragen.

Was sie erhalten

  • OpenAI-kompatible Inference-Endpunkte via vLLM, SGLang oder Ollama

  • Open-Weight-Modelle von DeepSeek, Qwen, Kimi, GLM, gpt-oss und Nemotron sowie mehrsprachige Embeddings

Anwendungsfälle

  • Copilots und Chatbot-Agenten (Continue.dev)
  • Selbst gehostetes RAG (AnythingLLM, Onyx, Verba)
  • Meeting- und Transkriptions-Apps (Fireflies, Fathom, Read.ai)
  • LLM-Gateways und -Router (OpenRouter)
  • Klassifizierung, Extraktion und Zusammenfassung im Batch

import boto3

from openai import OpenAI

s3  = boto3.client("s3",

endpoint_url="https://eu-central-2.storage.impossiblecloud.com")

llm = OpenAI(base_url="https://api.impossiblecloud.com/v1", api_key=KEY)


doc = s3.get_object(Bucket="legal-eu", Key="msa-2026.txt")["Body"].read().decode()
‍

answer = llm.chat.completions.create(

    model="llama-3.3-70b-instruct",

    messages=[{"role": "user", "content": f"Flag unusual indemnity terms:\n{doc}"}],

)

# Storage and inference in the same EU region — zero egress, one bill

Serverless Inference für Ihren Workload

Nennen Sie uns Modell und Workload. Wir melden uns zu Modell-Eignung und Verfügbarkeit.

Early Access anfragen

In drei Schritten zu Ihrem Serverless-Inference-Endpunkt:

Open-Weight-Modell auswählen oder passende Optionen empfehlen lassen

Anwendung und erwartetes Volumen in Tokens pro Sekunde angeben

Verfügbarkeit und Preise erhalten, abgerechnet pro Million Tokens

Tobias Nolte
Compute GTM
Online
Top Cloud Storage Award 2025ISO 27001 Certified

Compute, wo Ihre Daten liegen

Bei Impossible Cloud kommen Object Storage und GPU-Compute von einem Anbieter. Ihre Modelle laufen dort, wo Ihre Daten bereits liegen, ohne Daten zwischen Anbietern zu verschieben, bevor Sie sie nutzen können.

„Erst das Zusammenspiel von Co-located Storage und GPU-Rechenleistung hat unsere Architektur ermöglicht. Um Batch-Inferenz für Millionen von pathologischen Bildern skalierbar auszuführen, müssen Daten und Rechenleistung am selben Ort sein und dieser Ort muss für uns in Europa liegen.“
Chief Information Officer,
AI Lab für medizinische Bildgebung (Early-Access-Kunde)

Brauchen Sie stattdessen Bare Metal GPU-Server?

Serverless Inference läuft auf unserer Hardware. Wenn Sie die direkte Kontrolle brauchen, für dedizierte Bare-Metal-Performance, maximale Speicherkonfigurationen oder ein individuelles Cluster-Layout, konfiguriert und stellt unser Team die Infrastruktur nach Ihren Vorgaben bereit.

3D-Rendern des GPU-Servers