donator JOBS

Ещё на Temu

IT и программирование

Machine Learning Engineer - Inference Optimization - удалённая вакансия

Featherless AI

Откуда угодноУдалённо
Подать заявку

Ссылка ведёт на оригинальное объявление. Donator заявки не принимает.

Опубликовано: (вчера)Активна до: до 23 ноября 2026

Machine Learning Engineer - Inference Optimization - IT и программирование, удалённо

Featherless AI ищет специалиста на позицию Machine Learning Engineer - Inference Optimization. Вакансия относится к направлению IT и программирование и полностью удалённая. Компания не ограничивает местоположение кандидата, поэтому подать заявку можно откуда угодно.

В объявлении выделен Machine Learning, то есть опыт именно с этим инструментом окажется решающим.

Работодатель не указал сумму публично, это уточняется на собеседовании. Условий по рабочим часам объявление не ставит.

Эта вакансия прошла автоматическую проверку: в список не попадают объявления, где требуется иностранное разрешение на работу, спонсорство визы, гражданство определённой страны или проживание в ней.

Инструменты

Коротко

Компания
Featherless AI
Направление
IT и программирование
Кто может подать заявку
Из любой страны мира
Режим работы
Полностью удалённо
Инструменты
Machine Learning
Тип занятости
Полная занятость
Опубликовано
24 сентября 2026 (вчера)
Активна
до 23 ноября 2026
Источник
Himalayas

Получайте новые вакансии (IT и программирование) на почту

Доска обновляется несколько раз в день. Мы пишем только тогда, когда появляется новая проверенная вакансия. Ни спама, ни регистрации.

Уже подписаны? Управление настройками

Описание работодателя

About the Role We’re looking for a Machine Learning Engineer to own and push the limits of model inference performance at scale . You’ll work at the intersection of research and production-turning cutting-edge models into fast, reliable, and cost-efficient systems that serve real users. This role is ideal for someone who enjoys deep technical work, profiling systems down to the kernel/GPU level, and translating research ideas into production-grade performance gains. What You’ll Do

* Optimize inference latency, throughput, and cost for large-scale ML models in production

* Profile and bottleneck GPU/CPU inference pipelines (memory, kernels, batching, IO)

* Implement and tune techniques such as:

* Quantization (fp16, bf16, int8, fp8)

* KV-cache optimization & reuse

* Speculative decoding, batching, and streaming

* Model pruning or architectural simplifications for inference

* Collaborate with research engineers to productionize new model architectures

* Build and maintain inference-serving systems (e.g. Triton, custom runtimes, or bespoke stacks)

* Benchmark performance across hardware (NVIDIA / AMD GPUs, CPUs) and cloud setups

* Improve system reliability, observability, and cost efficiency under real workloads

What We’re Looking For

* Strong experience in ML inference optimization or high-performance ML systems

* Solid understanding of deep learning internals (attention, memory layout, compute graphs)

* Hands-on experience with PyTorch (or similar) and model deployment

* Familiarity with GPU performance tuning (CUDA, ROCm, Triton, or kernel-level optimizations)

* Experience scaling inference for real users (not just research benchmarks)

* Comfortable working in fast-moving startup environments with ownership and ambiguity

Nice to Have

* Experience with LLM or long-context model inference

* Knowledge of inference frameworks (TensorRT, ONNX Runtime, vLLM, Triton)

* Experience optimizing across different hardware vendors

* Open-source contributions in ML systems or inference tooling

* Background in distributed systems or low-latency services

Why Join Us

* Real ownership over performance-critical systems

* Direct impact on product reliability and unit economics

* Close collaboration with research, infra, and product

* Competitive compensation + meaningful equity at Series A

* A team that cares about engineering quality, not hype

Originally posted on Himalayas

Текст сохранён на языке оригинала работодателя, потому что и заявку вы подадите на том же языке.

Вакансия опубликована на Himalayas. Оригинальное объявление (Himalayas)

Частые вопросы об этой вакансии

Могу ли я откликнуться на Machine Learning Engineer - Inference Optimization оттуда, где живу?

Да. Featherless AI принимает на эту вакансию кандидатов из любой страны мира, то есть разрешение на работу в другой стране вам не нужно. Объявление прошло автоматическую проверку: если бы работодатель требовал разрешение на работу, визовую поддержку или проживание в конкретной стране, на доску оно бы не попало.

Какая оплата указана?

Featherless AI оплату по этой вакансии публично не указала. Большинство удалённых объявлений цифру не публикует, вопрос решается на собеседовании.

Как откликнуться?

Отклик отправляется напрямую работодателю, через оригинальное объявление, опубликованное на Himalayas. Donator отклики не принимает, комиссию не берёт и резюме не хранит.

Что это за вакансия?

Полностью удалённая позиция по направлению «IT и программирование». Гибридные объявления и всё, что требует присутствия в офисе, на доске не публикуются.

Бесплатные сертификаты для этой вакансии

Это объявление требует Machine Learning. Ниже бесплатные сертификаты, которые закрывают именно эти инструменты.

Все бесплатные сертификаты: IT и облака

Похожие вакансии

Выбрано на Temu

Удалённая вакансия: Machine Learning Engineer… | Donator