Exxeta

AI Inference Engineer (all genders)

Stellenbeschreibung:

Overview

Als AI Inference Engineer bauen Sie die technische Basis für produktive KI-Systeme in regulierten Umgebungen. Sie betreiben LLM-Inferenzplattformen vor Ort, in privaten Clouds oder souveränen europäischen Cloud-Setups und optimieren Leistung, Kosten und Beobachtbarkeit. Im Team integrieren Sie moderne Inferenz-Engines und Open-Weights-Modelle in Kubernetes-Umgebungen und entwickeln Referenzarchitekturen sowie Deployment-Templates für wiederverwendbare Lösungen.

Verantwortungsbereiche
  • Konzipieren, entwickeln und betreiben produktive LLM-Inferenzplattformen für kundenorientierte, regulierte Umgebungen
  • Integrieren von Inferenz-Engines und Open-Weights-Modellen in Kubernetes-/Container-Plattformen
  • Planen und optimieren von GPU- und Speicherressourcen sowie Inferenz-Workloads (Modellgrößen, Quantisierung, Batching, KV-Cache, Latenz, Durchsatz, Kosten)
  • Verantwortung für Runtime von AI-Systemen (Model Serving, APIs, Authentifizierung, Secrets, Observability, Logging)
  • Entwicklung von wiederverwendbaren Referenzarchitekturen, Deployment-Templates und Betriebs-Playbooks zur Applied-AI-Capability
  • Zusammenarbeit mit Cloud-, Platform-, Security- und Data-Engineering-Teams sowie Kunden zur Umsetzung von AI-Use-Cases
  • Beachtung von Seguridad, Governance, Logging und Compliance bereits in der Planungsphase
Zentrale Anforderungen
  • Erfahrung in Platform Engineering, Cloud Infrastructure, MLOps/LLMOps, DevOps oder Machine Learning Engineering
  • Verständnis von moderner LLM-Inferenz, Model-Serving, GPU-Auslastung, Quantisierung, Batching, KV-Cache-Management, Latenz, Durchsatz und Kosten
  • Kenntnisse in Docker, Kubernetes, Helm, Terraform, CI/CD, Linux, Observability
  • Fähigkeit, Transformer-basierte Modelle (LLMs/Embeddings) zu bewerten und produktive Entscheidungen zu treffen
  • Sicherheits- und Governance-Themen (Identitäten, Berechtigungen, Secrets, Logging, Auditierung, Compliance) insbesondere in regulierten Umgebungen
  • Kommunikationsfähigkeit und pragmatische Arbeitsweise in dynamischen Projekten
  • Pluspunkte: Erfahrung mit vLLM, SGLang, GPU-Clustern, souveränen/private Clouds
  • Reisebereitschaft und Fließend Deutsch/Englisch
  • klare Kommunikation
  • pragmatische Vorgehensweise
  • teamorientierung
  • Docker
  • Kubernetes
  • Helm
NOTE / HINWEIS:
EnglishEN: Please refer to Fuchsjobs for the source of your application
DeutschDE: Bitte erwähne Fuchsjobs, als Quelle Deiner Bewerbung

Stelleninformationen

  • Veröffentlichungsdatum:

    14 Sep 2026
  • Standort:

    Frankfurt am Main

    Einsatzort:

    Germany
  • Typ:

    Vollzeit
  • Arbeitsmodell:

    Vor Ort
  • Kategorie:

  • Erfahrung:

    2+ years
  • Arbeitsverhältnis:

    Angestellt

KI Suchagent

AI job search

Möchtest über ähnliche Jobs informiert werden? Dann beauftrage jetzt den Fuchsjobs KI Suchagenten!

Diese Jobs passen zu Deiner Suche: