donator JOBS

More on Temu

TI e programação

Machine Learning Engineer - Inference Optimization - vaga remota

Featherless AI

De qualquer lugarRemoto
Candidatar-se

O link leva ao anúncio original. Donator não recebe candidaturas.

Publicada: (hoje)Ativa até: até 23 de novembro de 2026

Machine Learning Engineer - Inference Optimization - TI e programação, remoto

A empresa Featherless AI está com uma vaga aberta de Machine Learning Engineer - Inference Optimization. A posição fica na área de TI e programação e é totalmente remota. A empresa não impõe restrição sobre onde o candidato mora, então você pode se candidatar de onde estiver.

O anúncio destaca Machine Learning, então a experiência com essa ferramenta é o que vai pesar.

A empresa não publicou nenhum valor, isso é acertado na entrevista. O anúncio não impõe condição nenhuma de horário.

Esta vaga passou por uma verificação automática: anúncios que exigem autorização de trabalho estrangeira, patrocínio de visto, uma nacionalidade específica ou residência em um país indicado não entram na lista.

Ferramentas

Em resumo

Empresa
Featherless AI
Área
TI e programação
Quem pode se candidatar
De qualquer país do mundo
Formato de trabalho
Totalmente remota
Ferramentas
Machine Learning
Tipo de contrato
Tempo integral
Publicada
24 de setembro de 2026 (hoje)
Ativa
até 23 de novembro de 2026
Fonte
Himalayas

Novas vagas de TI e programação por e-mail

O quadro é atualizado várias vezes por dia. Só escrevemos quando aparece uma vaga nova e já verificada. Sem spam e sem precisar de conta.

Já assinou? Gerenciar as configurações

Descrição da empresa

About the Role We’re looking for a Machine Learning Engineer to own and push the limits of model inference performance at scale . You’ll work at the intersection of research and production-turning cutting-edge models into fast, reliable, and cost-efficient systems that serve real users. This role is ideal for someone who enjoys deep technical work, profiling systems down to the kernel/GPU level, and translating research ideas into production-grade performance gains. What You’ll Do

* Optimize inference latency, throughput, and cost for large-scale ML models in production

* Profile and bottleneck GPU/CPU inference pipelines (memory, kernels, batching, IO)

* Implement and tune techniques such as:

* Quantization (fp16, bf16, int8, fp8)

* KV-cache optimization & reuse

* Speculative decoding, batching, and streaming

* Model pruning or architectural simplifications for inference

* Collaborate with research engineers to productionize new model architectures

* Build and maintain inference-serving systems (e.g. Triton, custom runtimes, or bespoke stacks)

* Benchmark performance across hardware (NVIDIA / AMD GPUs, CPUs) and cloud setups

* Improve system reliability, observability, and cost efficiency under real workloads

What We’re Looking For

* Strong experience in ML inference optimization or high-performance ML systems

* Solid understanding of deep learning internals (attention, memory layout, compute graphs)

* Hands-on experience with PyTorch (or similar) and model deployment

* Familiarity with GPU performance tuning (CUDA, ROCm, Triton, or kernel-level optimizations)

* Experience scaling inference for real users (not just research benchmarks)

* Comfortable working in fast-moving startup environments with ownership and ambiguity

Nice to Have

* Experience with LLM or long-context model inference

* Knowledge of inference frameworks (TensorRT, ONNX Runtime, vLLM, Triton)

* Experience optimizing across different hardware vendors

* Open-source contributions in ML systems or inference tooling

* Background in distributed systems or low-latency services

Why Join Us

* Real ownership over performance-critical systems

* Direct impact on product reliability and unit economics

* Close collaboration with research, infra, and product

* Competitive compensation + meaningful equity at Series A

* A team that cares about engineering quality, not hype

Originally posted on Himalayas

O texto permanece no idioma original da empresa, porque é nesse mesmo idioma que você vai se candidatar.

Esta vaga foi publicada em Himalayas. Anúncio original (Himalayas)

Perguntas frequentes sobre esta vaga

Posso me candidatar à vaga de Machine Learning Engineer - Inference Optimization de onde eu moro?

Sim. Para esta vaga, Featherless AI aceita candidatos de qualquer país do mundo, então você não precisa de autorização de trabalho de outro país. O anúncio passou por uma verificação automática: se a empresa exigisse autorização de trabalho, patrocínio de visto ou residência em um país específico, ele não estaria neste quadro.

Qual é a remuneração informada?

Para esta vaga, Featherless AI não divulgou remuneração. A maioria dos anúncios remotos não publica valor, isso é acertado na entrevista.

Como eu me candidato?

Você se candidata diretamente à empresa, pelo anúncio original publicado em Himalayas. Donator não recebe candidaturas, não cobra comissão e não guarda currículos.

Que tipo de vaga é esta?

Uma vaga totalmente remota na área de TI e programação. Anúncios híbridos e tudo o que exige presença no escritório não são publicados neste quadro.

Certificados gratuitos para esta vaga

Este anúncio pede Machine Learning. Abaixo estão os certificados gratuitos que cobrem exatamente essas ferramentas.

Todos os certificados gratuitos: IT and cloud

Vagas parecidas

Picked on Temu

Vaga remota: Machine Learning Engineer - Infere… | Donator