Logo for evoila

(Senior) AI Platform Engineer (m/f/d)

Role overview

Qualifications

  • At least 3 years of experience in operating and optimizing platforms and services at scale in Kubernetes environments, whether on-premise or in the cloud.
  • Solid knowledge in the architecture and operation of scalable solutions using Kubernetes, ideally including GPU workloads.
  • Programming skills in Python, ideally supplemented by Golang or Java.
  • Experience with at least one model-serving framework (e.g., vLLM, NVIDIA Triton, KServe) and initial or advanced experience with MLOps tools (e.g., MLflow, Kubeflow, ClearML).

Responsibilities

  • Plan, build, and operate highly available AI/ML platforms and services, particularly based on Kubernetes in on-premises, hybrid, and cloud environments.
  • Design and implement scalable GPU infrastructures within Kubernetes clusters, including GPU scheduling and sharing for efficiency.
  • Develop and operate MLOps/LLMOps workflows for productive GenAI services, including monitoring and regression testing.
  • Consult with clients on best practices, AI governance, data security, and privacy in context of AI platforms on Kubernetes.

Key facts

Hard skills

Other skills

  • Communication

About the company

evoila logo

evoila

IT Services & IT Consulting

Unknown

Company details

IndustryIT Services & IT Consulting
Company size201 - 500

Your match analysis

See how your profile stacks up against this role.

We compared the job requirements to your profile to show where you're strong and where you fall short.

Job description

Karriere bei der evoila Germany GmbH

Du möchtest dein nächstes Karrierelevel erreichen und in einem dynamischen, leistungsstarken Team mit echten Zukunftschancen arbeiten?


Die evoila Germany GmbH ist ein eigentümergeführtes IT‑Unternehmen mit Fokus auf Cloud, Security und Data.


Unsere Kunden schätzen besonders unsere zukunftsorientierten Lösungen und unser DevOps‑Modell – von IT Consulting über Konzeption, Entwicklung und Implementierung bis hin zu Managed Services und Support. Bei uns erlebst du Teamgeist und ein Umfeld, in dem du aktiv mitgestalten kannst, mit klaren Perspektiven für deine persönliche und fachliche Weiterentwicklung.

(Senior) AI Platform Engineer (m/f/d)


Du brennst für Kubernetes, Plattform-Engineering und moderne AI-Technologien? Du möchtest nicht nur einzelne Modelle deployen, sondern die Infrastruktur und Plattformen schaffen, auf denen innovative AI-Anwendungen zuverlässig, sicher und skalierbar betrieben werden?

Dann bist du bei uns genau richtig.

Als (Senior) AI Platform Engineer (m/f/d) entwickelst, betreibst und optimierst du moderne AI- und ML-Plattformen für unsere Kunden. Du arbeitest mit Kubernetes, GPU-Infrastrukturen, Infrastructure as Code sowie modernen CI/CD-, MLOps- und LLMOps-Ansätzen und unterstützt Unternehmen dabei, Generative AI und Machine Learning erfolgreich in den produktiven Einsatz zu bringen.

Dich erwarten spannende Projekte in unterschiedlichsten Branchen, technologischer Gestaltungsspielraum und ein Team aus Cloud-, Plattform-, Data- und AI-Spezialisten, das Innovation nicht nur diskutiert, sondern täglich umsetzt.


Tätigkeitsschwerpunkte:


  • Planung, Aufbau und Betrieb von hochverfügbaren AI/ML-Plattformen und -Services, insbesondere auf Basis von Kubernetes in On-Premises-, Hybrid- und Cloud-Umgebungen.
  • Design und Umsetzung skalierbarer GPU-Infrastrukturen innerhalb von Kubernetes-Clustern – inklusive GPU-Scheduling und -Sharing (z. B. Kueue, KAI-Scheduler, Run:ai, NVIDIA MIG/Time-Slicing) mit Blick auf Auslastung und Kosteneffizienz.
  • Aufbau und Betrieb von Model-Serving- und Inferenz-Diensten (z. B. vLLM, NVIDIA Triton, KServe, NVIDIA NIM, Ray) für klassische ML-Modelle und Large Language Models.
  • Entwicklung und Betrieb von MLOps-/LLMOps-Workflows für produktive GenAI-Services – inklusive Guardrails & Policies, Evaluierung, Regressionstests sowie Kosten- und Qualitätsmonitoring.
  • Bereitstellung von Fine-Tuning- und Re-Training-Workflows (z. B. LoRA, kontinuierliches Re-Training) auf der Plattform.
  • Monitoring, Troubleshooting und Performance-Tuning von AI-Plattformen (u. a. GPU-Auslastung, Inferenz-Latenz, Durchsatz), um höchste Performance und Verfügbarkeit sicherzustellen.
  • Beratung unserer Kunden in Bezug auf Best Practices, AI-Governance, Datensicherheit und Datenschutz im Kontext von AI-Plattformen auf Kubernetes.
  • Enge Zusammenarbeit mit Data-Science-, Data-Platform- und Entwicklungsteams zur Sicherstellung der nahtlosen Integration von AI-Lösungen.


Deine Qualifikation:


  • Mindestens 3 Jahre Erfahrung im Betrieb und der Optimierung von Plattformen und Services at Scale in Kubernetes-Umgebungen, egal ob On-Premise oder in der Cloud.
  • Fundierte Kenntnisse in der Architektur und dem Betrieb von skalierbaren Lösungen unter Verwendung von Kubernetes, idealerweise inklusive GPU-Workloads.
  • Programmierkenntnisse in Python, idealerweise ergänzt um Golang oder Java.
  • Erfahrung mit mindestens einem Model-Serving-Framework (z. B. vLLM, NVIDIA Triton, KServe) sowie erste oder vertiefte Erfahrung mit MLOps-Werkzeugen (z. B. MLflow, Kubeflow, ClearML).
  • Erfahrung mit Infrastructure-as-Code-Tools wie Ansible und Terraform sowie CI/CD- und GitOps-Werkzeugen (z. B. Argo CD, Flux).
  • Sehr gute Kommunikationsfähigkeiten in Deutsch und Englisch. Idealerweise hast du bereits Kunden beraten und kannst technische Themen zielgruppengerecht vermitteln – vom Engineering-Team bis zum Management.


Für die Senior-Rolle zusätzlich:


  • Mindestens 5 Jahre einschlägige Erfahrung im Plattform-Engineering.
  • Architektur-Ownership: Du verantwortest das Design von AI-Plattformen end-to-end und triffst technologische Grundsatzentscheidungen.
  • Technische Führung in Kundenprojekten (Lead-Rolle) sowie Mentoring von Kolleginnen und Kollegen.


Darüber hinaus verfügst du idealerweise über:


  • Erfahrung mit Cloud-AI-Diensten (z. B. AWS SageMaker/Bedrock, Azure ML/Azure OpenAI/Azure AI Foundry) und deren Integration mit Kubernetes-Workloads.
  • Kenntnisse im Betrieb von LLM-basierten Architekturen, z. B. RAG-Pipelines, Vektordatenbanken und Embedding-Services sowie Agentic-AI-Ansätze und Model Context Protocol (MCP).
  • Verständnis von System-Level-Grundlagen des LLM-Servings (Rate Limiting, Token Streaming, Load Balancing) und LLM-Konzepten wie Reasoning, Tool Calling und Prompt Templates.
  • Erfahrung mit neuen Serving-Bausteinen wie llm-d oder Kubernetes Inference Gateway.
  • Kenntnisse in der Absicherung von AI-Plattformen, z. B. TLS, RBAC und Network Policies innerhalb von Kubernetes-Umgebungen, sowie Grundverständnis von AI-Governance (z. B. EU AI Act).
  • Zertifizierungen im Bereich relevanter Technologien (z. B. Certified Kubernetes Administrator/Developer, NVIDIA-Zertifizierungen).
  • Bereitschaft zu gelegentlichen Reisen im DACH-Raum.


Wir bieten dir u.a.: 

  • Betriebliche Altersvorsorge  
  • Teamorientierte Unternehmenskultur mit regelmäßigen Teamevents  
  • Gezielte Förderung deiner fachlichen Weiterentwicklung  
  • Corporate Benefits Programm  
  • Flexible Arbeitszeiten  
  • Moderner Arbeitsplatz mit zeitgemäßer Ausstattung  
  • Remote-Work-Möglichkeiten 


Wir freuen uns auf deine Online-Bewerbung und darauf, mehr über dich zu erfahren.


We get IT done. 🚀 

Apply once. Then go straight to the hiring manager.

After you apply, unlock the direct contact details of the people who actually make the call. A quick follow-up makes you 5x more likely to land an interview.

MR

Marcus Rivera

Chief Revenue Officer

m.rivera@company.com
linkedin.com/in/marcusrivera
Unlocked after you apply
·

Platform Engineer Related jobs

Other jobs at evoila

Premium

Reach out to the hiring manager directly.

Gain access to the contact details of the hiring managers who actually decide, and reach out to network with them directly. That, plus more when you upgrade:

  • Full match report with fit score and gaps
  • Career diagnostics on how recruiters read you
  • Curated company matches and warm intros
  • 48h early access to new roles

Cancel anytime.