donator JOBS

More on Temu

IT i programowanie

Machine Learning Engineer - Inference Optimization - praca zdalna

Featherless AI

Z dowolnego miejscaZdalnie
Aplikuj

Link prowadzi do pierwotnego ogłoszenia. Donator nie przyjmuje zgłoszeń.

Nowe oferty na Telegramie

Każda nowa oferta zdalna, zaraz po publikacji.

@donator_jobs_pl

Otwórz kanał
Opublikowano: (dzisiaj)Aktywna do: do 23 listopada 2026

Machine Learning Engineer - Inference Optimization - IT i programowanie, zdalnie

Firma Featherless AI szuka osoby na stanowisko Machine Learning Engineer - Inference Optimization. Oferta należy do kategorii „IT i programowanie” i jest w pełni zdalna. Firma nie ogranicza miejsca zamieszkania kandydata, więc zgłoszenie można wysłać z dowolnego miejsca.

Ogłoszenie wyróżnia jedno narzędzie: Machine Learning. To doświadczenie właśnie z nim przeważy.

Firma nie podała żadnej kwoty, ustala się to na rozmowie. Ogłoszenie nie stawia żadnych warunków co do godzin pracy.

Ta oferta przeszła automatyczną kontrolę: na listę nie trafiają ogłoszenia wymagające zagranicznego pozwolenia na pracę, sponsorowania wizy, określonego obywatelstwa ani zamieszkania we wskazanym kraju.

W skrócie

Firma
Featherless AI
Kategoria
IT i programowanie
Kto może aplikować
Z dowolnego kraju na świecie
Tryb pracy
W pełni zdalnie
Narzędzia
Machine Learning
Forma zatrudnienia
Pełny etat
Opublikowano
24 września 2026 (dzisiaj)
Aktywna
do 23 listopada 2026
Źródło
Himalayas

Nowe oferty na skrzynkę (IT i programowanie)

Tablica jest aktualizowana kilka razy dziennie. Piszemy tylko wtedy, gdy pojawia się nowa, sprawdzona oferta. Bez spamu i bez zakładania konta.

Subskrypcja już aktywna? Zarządzaj ustawieniami

Opis firmy

About the Role We’re looking for a Machine Learning Engineer to own and push the limits of model inference performance at scale . You’ll work at the intersection of research and production-turning cutting-edge models into fast, reliable, and cost-efficient systems that serve real users. This role is ideal for someone who enjoys deep technical work, profiling systems down to the kernel/GPU level, and translating research ideas into production-grade performance gains. What You’ll Do

* Optimize inference latency, throughput, and cost for large-scale ML models in production

* Profile and bottleneck GPU/CPU inference pipelines (memory, kernels, batching, IO)

* Implement and tune techniques such as:

* Quantization (fp16, bf16, int8, fp8)

* KV-cache optimization & reuse

* Speculative decoding, batching, and streaming

* Model pruning or architectural simplifications for inference

* Collaborate with research engineers to productionize new model architectures

* Build and maintain inference-serving systems (e.g. Triton, custom runtimes, or bespoke stacks)

* Benchmark performance across hardware (NVIDIA / AMD GPUs, CPUs) and cloud setups

* Improve system reliability, observability, and cost efficiency under real workloads

What We’re Looking For

* Strong experience in ML inference optimization or high-performance ML systems

* Solid understanding of deep learning internals (attention, memory layout, compute graphs)

* Hands-on experience with PyTorch (or similar) and model deployment

* Familiarity with GPU performance tuning (CUDA, ROCm, Triton, or kernel-level optimizations)

* Experience scaling inference for real users (not just research benchmarks)

* Comfortable working in fast-moving startup environments with ownership and ambiguity

Nice to Have

* Experience with LLM or long-context model inference

* Knowledge of inference frameworks (TensorRT, ONNX Runtime, vLLM, Triton)

* Experience optimizing across different hardware vendors

* Open-source contributions in ML systems or inference tooling

* Background in distributed systems or low-latency services

Why Join Us

* Real ownership over performance-critical systems

* Direct impact on product reliability and unit economics

* Close collaboration with research, infra, and product

* Competitive compensation + meaningful equity at Series A

* A team that cares about engineering quality, not hype

Originally posted on Himalayas

Treść pozostaje w języku, w którym opublikowała ją firma, bo w tym samym języku wysyła się zgłoszenie.

Ta oferta została opublikowana w serwisie Himalayas. Pierwotne ogłoszenie (Himalayas)

Częste pytania o tę ofertę

Czy mogę aplikować na stanowisko Machine Learning Engineer - Inference Optimization z miejsca, w którym mieszkam?

Tak. W tej ofercie firma Featherless AI przyjmuje kandydatów z dowolnego kraju na świecie, więc pozwolenie na pracę w innym kraju nie jest potrzebne. Ogłoszenie przeszło automatyczną kontrolę: gdyby firma wymagała pozwolenia na pracę, sponsorowania wizy albo zamieszkania w konkretnym kraju, nie trafiłoby na tę tablicę.

Jakie wynagrodzenie jest podane?

W tej ofercie firma Featherless AI nie podała żadnej kwoty. Większość ogłoszeń zdalnych nie podaje żadnej liczby, ustala się to na rozmowie.

Jak wysłać zgłoszenie?

Zgłoszenie wysyła się bezpośrednio do firmy, przez pierwotne ogłoszenie opublikowane w serwisie Himalayas. Donator nie przyjmuje zgłoszeń, nie pobiera prowizji i nie przechowuje CV.

Co to za oferta?

W pełni zdalne stanowisko w kategorii "IT i programowanie". Ogłoszenia hybrydowe i te, które wymagają obecności w biurze, nie trafiają na tę tablicę.

Bezpłatne certyfikaty do tej oferty

To ogłoszenie wymaga następujących narzędzi: Machine Learning. Poniżej są bezpłatne certyfikaty, które obejmują dokładnie te narzędzia.

Wszystkie bezpłatne certyfikaty: IT and cloud

Podobne oferty

Picked on Temu

Oferta zdalna: Machine Learning Engineer - Infe… | Donator