donator JOBS

More on Temu

IT und Programmierung

Machine Learning Engineer - Inference Optimization - Remote-Stelle

Featherless AI

Von überallRemote
Bewerben

Der Link führt zur ursprünglichen Anzeige. Donator nimmt keine Bewerbungen entgegen.

Neue Stellen auf Telegram

Jede neue Remote-Stelle, sobald sie eintrifft.

@donator_jobs_de

Kanal öffnen
Veröffentlicht: (gestern)Aktiv bis: bis 23. November 2026

Machine Learning Engineer - Inference Optimization - IT und Programmierung, remote

Featherless AI sucht Machine Learning Engineer - Inference Optimization. Die Stelle liegt im Bereich IT und Programmierung und ist vollständig remote. Das Unternehmen schränkt den Wohnort der Kandidatin nicht ein, Sie können sich also von überall bewerben.

Die Anzeige hebt Machine Learning hervor, Erfahrung mit genau diesem Werkzeug gibt also den Ausschlag.

Das Unternehmen hat keine Zahl veröffentlicht, das klärt sich im Gespräch. Zu den Arbeitszeiten stellt die Anzeige keine Bedingung.

Diese Stelle hat eine automatische Prüfung durchlaufen: Anzeigen, die eine ausländische Arbeitserlaubnis, Visa-Sponsoring, eine bestimmte Staatsangehörigkeit oder den Wohnsitz in einem genannten Land verlangen, kommen nicht auf die Liste.

Kurz gefasst

Unternehmen
Featherless AI
Bereich
IT und Programmierung
Wer sich bewerben darf
Aus jedem Land der Welt
Arbeitsform
Vollständig remote
Werkzeuge
Machine Learning
Beschäftigungsart
Vollzeit
Veröffentlicht
24. September 2026 (gestern)
Aktiv
bis 23. November 2026
Quelle
Himalayas

Neue Stellen im Bereich IT und Programmierung per E-Mail

Das Board wird mehrmals täglich aktualisiert. Wir schreiben nur, wenn eine neue, geprüfte Stelle erscheint. Kein Spam, kein Konto nötig.

Schon abonniert? Einstellungen verwalten

Beschreibung des Unternehmens

About the Role We’re looking for a Machine Learning Engineer to own and push the limits of model inference performance at scale . You’ll work at the intersection of research and production-turning cutting-edge models into fast, reliable, and cost-efficient systems that serve real users. This role is ideal for someone who enjoys deep technical work, profiling systems down to the kernel/GPU level, and translating research ideas into production-grade performance gains. What You’ll Do

* Optimize inference latency, throughput, and cost for large-scale ML models in production

* Profile and bottleneck GPU/CPU inference pipelines (memory, kernels, batching, IO)

* Implement and tune techniques such as:

* Quantization (fp16, bf16, int8, fp8)

* KV-cache optimization & reuse

* Speculative decoding, batching, and streaming

* Model pruning or architectural simplifications for inference

* Collaborate with research engineers to productionize new model architectures

* Build and maintain inference-serving systems (e.g. Triton, custom runtimes, or bespoke stacks)

* Benchmark performance across hardware (NVIDIA / AMD GPUs, CPUs) and cloud setups

* Improve system reliability, observability, and cost efficiency under real workloads

What We’re Looking For

* Strong experience in ML inference optimization or high-performance ML systems

* Solid understanding of deep learning internals (attention, memory layout, compute graphs)

* Hands-on experience with PyTorch (or similar) and model deployment

* Familiarity with GPU performance tuning (CUDA, ROCm, Triton, or kernel-level optimizations)

* Experience scaling inference for real users (not just research benchmarks)

* Comfortable working in fast-moving startup environments with ownership and ambiguity

Nice to Have

* Experience with LLM or long-context model inference

* Knowledge of inference frameworks (TensorRT, ONNX Runtime, vLLM, Triton)

* Experience optimizing across different hardware vendors

* Open-source contributions in ML systems or inference tooling

* Background in distributed systems or low-latency services

Why Join Us

* Real ownership over performance-critical systems

* Direct impact on product reliability and unit economics

* Close collaboration with research, infra, and product

* Competitive compensation + meaningful equity at Series A

* A team that cares about engineering quality, not hype

Originally posted on Himalayas

Der Text ist in der Originalsprache des Unternehmens erhalten, denn in derselben Sprache bewerben Sie sich auch.

Diese Stelle wurde auf Himalayas veröffentlicht. Ursprüngliche Anzeige (Himalayas)

Häufige Fragen zu dieser Stelle

Kann ich mich von dort, wo ich lebe, auf Machine Learning Engineer - Inference Optimization bewerben?

Ja. Featherless AI nimmt für diese Stelle Kandidaten aus jedem Land der Welt an, Sie brauchen also keine Arbeitserlaubnis für ein anderes Land. Die Anzeige hat eine automatische Prüfung durchlaufen: Hätte das Unternehmen eine Arbeitserlaubnis, Visa-Sponsoring oder Wohnsitz in einem bestimmten Land verlangt, stünde sie nicht auf diesem Board.

Welche Vergütung ist angegeben?

Featherless AI hat für diese Stelle keine Vergütung veröffentlicht. Die meisten Remote-Anzeigen nennen keine Zahl, das klärt sich im Gespräch.

Wie bewerbe ich mich?

Sie bewerben sich direkt beim Unternehmen, über die ursprüngliche Anzeige auf Himalayas. Donator nimmt keine Bewerbungen entgegen, verlangt keine Provision und speichert keinen Lebenslauf.

Was für eine Stelle ist das?

Eine vollständig remote ausgeübte Rolle im Bereich IT und Programmierung. Hybride Anzeigen und alles mit Bürozwang veröffentlichen wir auf diesem Board nicht.

Kostenlose Zertifikate für diese Stelle

Diese Anzeige verlangt Machine Learning. Unten stehen die kostenlosen Nachweise, die genau diese Werkzeuge abdecken.

Alle kostenlosen Zertifikate: IT and cloud

Ähnliche Stellen

Picked on Temu

Remote-Stelle: Machine Learning Engineer - Infe… | Donator