Likeremote

Subscribe to the latest remote jobs:

  • Likeremote jobs on https://LinkedIn.com/
  • Likeremote jobs on https://telegram.org/
  • Likeremote jobs on Reddit.com
4

LLM Engineer (Optimization)

42dot
๐Ÿ‡ฐ๐Ÿ‡ท South Korea
Hybrid
1 day ago
  • AI
  • vLLM
  • TensorRT
  • ONNX
  • CUDA
  • Triton
  • Machine Learning
  • PyTorch
  • Python
  • C++
  • Kubernetes
  • AI/ML
Not scoredNo CV on file. Upload one and this job gets a score out of 100.Upload CV

About the Team & Mission

ย 

LLM Engineer (Optimization)๋Š” ๋Œ€๊ทœ๋ชจ ์–ธ์–ด ๋ชจ๋ธ(LLM)์˜ ์ถ”๋ก  ์„ฑ๋Šฅ(Inference Performance)์„ ๊ทน๋Œ€ํ™”ํ•˜์—ฌ ์‹ค์ œ ์„œ๋น„์Šค ํ™˜๊ฒฝ์— ์ตœ์ ํ™”๋œ AI ์‹œ์Šคํ…œ์„ ๊ฐœ๋ฐœํ•ฉ๋‹ˆ๋‹ค.

์„œ๋ฒ„(GPU Cluster)๋ถ€ํ„ฐ Edge ๋ฐ On-device ํ™˜๊ฒฝ๊นŒ์ง€ ๋‹ค์–‘ํ•œ ํ•˜๋“œ์›จ์–ด์—์„œ ์ตœ๊ณ ์˜ ์„ฑ๋Šฅ๊ณผ ํšจ์œจ์„ ๋‹ฌ์„ฑํ•  ์ˆ˜ ์žˆ๋„๋ก Inference Engine, Runtime, Compiler ๋ฐ Model Optimization ๊ธฐ์ˆ ์„ ์—ฐ๊ตฌยท๊ฐœ๋ฐœํ•ฉ๋‹ˆ๋‹ค. ์ตœ์‹  LLM Serving ๊ธฐ์ˆ ๊ณผ GPU/Accelerator ์ตœ์ ํ™”๋ฅผ ํ™œ์šฉํ•˜์—ฌ ๊ณ ์„ฑ๋Šฅยท์ €์ง€์—ฐยท์ €๋น„์šฉ AI ์„œ๋น„์Šค๋ฅผ ๊ตฌํ˜„ํ•˜๋Š” ํ•ต์‹ฌ ์—ญํ• ์„ ์ˆ˜ํ–‰ํ•ฉ๋‹ˆ๋‹ค.

ย 

Responsibilities

  • LLM Inference Optimization

    • ๋Œ€๊ทœ๋ชจ ์–ธ์–ด ๋ชจ๋ธ(LLM)์˜ ์ถ”๋ก  ์„ฑ๋Šฅ(Latency, Throughput, Memory Efficiency)์„ ์ตœ์ ํ™”ํ•ฉ๋‹ˆ๋‹ค.

    • ๋‹ค์–‘ํ•œ ๋ชจ๋ธ ๊ตฌ์กฐ ๋ฐ ์ถ”๋ก  ํ™˜๊ฒฝ์— ๋งž๋Š” ์ตœ์ ํ™” ๊ธฐ๋ฒ•์„ ์—ฐ๊ตฌํ•˜๊ณ  ์ ์šฉํ•ฉ๋‹ˆ๋‹ค.

    • Long Context, Multi-turn Conversation ๋“ฑ ์‹ค์ œ ์„œ๋น„์Šค ํ™˜๊ฒฝ์—์„œ์˜ ์„ฑ๋Šฅ์„ ๊ฐœ์„ ํ•ฉ๋‹ˆ๋‹ค.

  • Inference Engine ๋ฐ Runtime ๊ฐœ๋ฐœ

    • GPU ๋ฐ Accelerator ๊ธฐ๋ฐ˜ LLM Inference Engine์„ ๊ฐœ๋ฐœํ•˜๊ณ  ์ตœ์ ํ™”ํ•ฉ๋‹ˆ๋‹ค.

    • vLLM, TensorRT-LLM, SGLang, llama.cpp, ONNX Runtime, MLX ๋“ฑ ์ตœ์‹  Inference Framework๋ฅผ ํ™œ์šฉํ•˜๊ฑฐ๋‚˜ ๊ฐœ์„ ํ•ฉ๋‹ˆ๋‹ค.

    • Speculative Decoding, Prefill-Decode Disaggregation ๋“ฑ ์ตœ์‹  Serving ๊ธฐ์ˆ ์„ ์ ์šฉํ•ฉ๋‹ˆ๋‹ค.

  • Model Compression ๋ฐ Compiler Optimization

    • Quantization(MXFP8, NVFP4, AWQ, GPTQ ๋“ฑ) Pruning, Distillation ๋“ฑ ๋ชจ๋ธ ๊ฒฝ๋Ÿ‰ํ™” ๊ธฐ๋ฒ•์„ ์—ฐ๊ตฌํ•˜๊ณ  ์ ์šฉํ•ฉ๋‹ˆ๋‹ค.

    • CUDA, Triton, TensorRT, TVM, MLIR ๋“ฑ Compiler ๋ฐ Kernel Optimization์„ ํ™œ์šฉํ•˜์—ฌ ์ถ”๋ก  ์„ฑ๋Šฅ์„ ํ–ฅ์ƒํ•ฉ๋‹ˆ๋‹ค.

    • GPU Memory ๋ฐ Kernel ํšจ์œจ์„ ๋ถ„์„ํ•˜๊ณ  ์ตœ์ ํ™”ํ•ฉ๋‹ˆ๋‹ค.

  • Edge AI ๋ฐ On-device Optimization

    • Mobile, Embedded, Edge Device ํ™˜๊ฒฝ์—์„œ LLM์„ ํšจ์œจ์ ์œผ๋กœ ์‹คํ–‰ํ•˜๊ธฐ ์œ„ํ•œ ์ตœ์ ํ™” ๊ธฐ์ˆ ์„ ๊ฐœ๋ฐœํ•ฉ๋‹ˆ๋‹ค.

    • CPU, GPU, NPU ๋“ฑ ๋‹ค์–‘ํ•œ ํ•˜๋“œ์›จ์–ด ์•„ํ‚คํ…์ฒ˜์— ๋งž๋Š” ์ตœ์ ํ™” ์ „๋žต์„ ์ˆ˜๋ฆฝํ•ฉ๋‹ˆ๋‹ค.

    • ์ œํ•œ๋œ ๋ฆฌ์†Œ์Šค ํ™˜๊ฒฝ์—์„œ๋„ ๋†’์€ ์„ฑ๋Šฅ๊ณผ ๋‚ฎ์€ ์ „๋ ฅ ์†Œ๋น„๋ฅผ ๋‹ฌ์„ฑํ•  ์ˆ˜ ์žˆ๋„๋ก ์ตœ์ ํ™”ํ•ฉ๋‹ˆ๋‹ค.

  • Performance Analysis ๋ฐ Benchmark

    • ๋‹ค์–‘ํ•œ ํ•˜๋“œ์›จ์–ด ๋ฐ Inference Backend์˜ ์„ฑ๋Šฅ์„ ๋ถ„์„ํ•˜๊ณ  Benchmark๋ฅผ ์ˆ˜ํ–‰ํ•ฉ๋‹ˆ๋‹ค.

    • NVIDIA Nsight Systems, Nsight Compute, py-spy ๋“ฑ์˜ Profiling Tool์„ ํ™œ์šฉํ•˜์—ฌ GPU ๋ฐ Runtime ๋ณ‘๋ชฉ์„ ๋ถ„์„ํ•˜๊ณ  ์ง€์†์ ์œผ๋กœ ์ถ”๋ก  ์„ฑ๋Šฅ์„ ๊ฐœ์„ ํ•ฉ๋‹ˆ๋‹ค.

    • ์ฃผ์–ด์ง„ Prompt ๋ฐ ์„œ๋น„์Šค ์š”๊ตฌ์‚ฌํ•ญ์— ๋งž์ถฐ ๋ชจ๋ธ ํ’ˆ์งˆ, ์ถ”๋ก  ์„ฑ๋Šฅ(Latency/Throughput), ๋น„์šฉ ๊ฐ„์˜ Trade-off๋ฅผ ์ตœ์ ํ™”ํ•˜๊ณ , ์ด์— ์ ํ•ฉํ•œ Serving Architecture๋ฅผ ์„ค๊ณ„ํ•ฉ๋‹ˆ๋‹ค.

ย 

Qualifications

  • ILLM, Machine Learning Infrastructure ๋˜๋Š” Inference Optimization ๊ด€๋ จ ๊ฒฝ๋ ฅ 3๋…„ ์ด์ƒ

  • LLM Inference Engine ๋˜๋Š” AI Runtime ๊ฐœ๋ฐœ ๊ฒฝํ—˜

  • GPU Architecture, CUDA Programming ๋˜๋Š” ๋ณ‘๋ ฌ ์ปดํ“จํŒ…์— ๋Œ€ํ•œ ์ดํ•ด

  • Quantization, Model Compression, Compiler Optimization ๋“ฑ ๋ชจ๋ธ ์ตœ์ ํ™” ๊ธฐ์ˆ ์— ๋Œ€ํ•œ ์ดํ•ด

  • PyTorch, ONNX, TensorRT ๋“ฑ ๋”ฅ๋Ÿฌ๋‹ ํ”„๋ ˆ์ž„์›Œํฌ ํ™œ์šฉ ๊ฒฝํ—˜

  • Python ๋ฐ C/C++ ์ค‘ ํ•˜๋‚˜ ์ด์ƒ์˜ ์–ธ์–ด์— ๋Šฅ์ˆ™ํ•˜๋ฉฐ, ์†Œํ”„ํŠธ์›จ์–ด ์—”์ง€๋‹ˆ์–ด๋ง ์—ญ๋Ÿ‰์„ ๋ณด์œ ํ•˜์‹  ๋ถ„

  • ์„ฑ๋Šฅ ๋ถ„์„ ๋ฐ ๋ฌธ์ œ ํ•ด๊ฒฐ ๋Šฅ๋ ฅ๊ณผ ํ˜‘์—… ์—ญ๋Ÿ‰์„ ๊ฐ–์ถ”์‹  ๋ถ„

ย 

Preferred Qualifications

  • vLLM, TensorRT-LLM, SGLang, llama.cpp, MLX, ONNX Runtime ๋“ฑ LLM Serving Framework ํ™œ์šฉ ๋˜๋Š” ๊ฐœ๋ฐœ ๊ฒฝํ—˜

  • CUDA, Triton Kernel ๋˜๋Š” Custom Operator ๊ฐœ๋ฐœ ๊ฒฝํ—˜

  • Speculative Decoding, Prefill-Decode Disaggregation, KV Cache Compression, Expert Parallelism(MoE) ๋“ฑ ์ตœ์‹  LLM Inference Optimization ๋ฐ Serving ๊ธฐ์ˆ  ๊ฒฝํ—˜

  • NVIDIA GPU(H100, B200 ๋“ฑ), AMD GPU ๋˜๋Š” ๋‹ค์–‘ํ•œ AI Accelerator ์ตœ์ ํ™” ๊ฒฝํ—˜

  • Edge AI ๋ฐ On-device LLM ์ตœ์ ํ™” ๊ฒฝํ—˜(Orin, Thor, Qualcomm, Apple Silicon ๋“ฑ)

  • Kubernetes ๊ธฐ๋ฐ˜ AI Serving ๋˜๋Š” ๋Œ€๊ทœ๋ชจ GPU Cluster ์šด์˜ ๊ฒฝํ—˜

  • LLM Fine-tuning ๋ฐ Distributed Training์— ๋Œ€ํ•œ ์ดํ•ด

  • AI Systems, ML Systems ๋˜๋Š” LLM Infrastructure ๊ด€๋ จ ์˜คํ”ˆ์†Œ์Šค ๊ธฐ์—ฌ ๊ฒฝํ—˜

  • AI/ML Systems ๋ถ„์•ผ์˜ ์šฐ์ˆ˜ ํ•™ํšŒ(NeurIPS, ICML, ICLR, MLSys, OSDI, NSDI, ASPLOS ๋“ฑ) ๋…ผ๋ฌธ ๋ฐœํ‘œ ๋˜๋Š” ์ด์— ์ค€ํ•˜๋Š” ์—ฐ๊ตฌ ๊ฒฝํ—˜

ย 

Interview Process

  • ์„œ๋ฅ˜ ์ „ํ˜•

  • ์ฝ”๋”ฉยท๊ณผ์ œ ํ…Œ์ŠคํŠธ

  • 1์ฐจ ๋ฉด์ ‘ (ํ™”์ƒ, 1์‹œ๊ฐ„ ๋‚ด์™ธ)

  • 2์ฐจ ๋ฉด์ ‘ (๋Œ€๋ฉด ํ˜น์€ ํ™”์ƒ, 3์‹œ๊ฐ„ ๋‚ด์™ธ)

  • ์ฒ˜์šฐ ํ˜‘์˜ยท์ž…์‚ฌ

ย 

Additional Information

  • ์ „ํ˜• ์ ˆ์ฐจ๋Š” ์ผ์ • ๋ฐ ์ง„ํ–‰ ์ƒํ™ฉ์— ๋”ฐ๋ผ ์ผ๋ถ€ ๋ณ€๊ฒฝ๋  ์ˆ˜ ์žˆ์œผ๋ฉฐ, ๊ฐ ์ „ํ˜• ๊ฒฐ๊ณผ๋Š” ๋“ฑ๋กํ•˜์‹  ์ด๋ฉ”์ผ๋กœ ๊ฐœ๋ณ„ ์•ˆ๋‚ด๋“œ๋ฆฝ๋‹ˆ๋‹ค.

  • ์ง€์›์„œ ์ œ์ถœ ์‹œ ์ฃผ๋ฏผ๋“ฑ๋ก๋ฒˆํ˜ธ, ๊ฐ€์กฑ๊ด€๊ณ„, ํ˜ผ์ธ ์—ฌ๋ถ€, ์—ฐ๋ด‰, ์‚ฌ์ง„, ์‹ ์ฒด์กฐ๊ฑด, ์ถœ์‹  ์ง€์—ญ ๋“ฑ ์ฑ„์šฉ์ ˆ์ฐจ๋ฒ•์ƒ ์š”๊ตฌ ๊ธˆ์ง€๋œ ์ •๋ณด๋Š” ์ œ์™ธ ๋ถ€ํƒ๋“œ๋ฆฝ๋‹ˆ๋‹ค.

  • ์ง€์›์„œ ์ ‘์ˆ˜ ์ค‘ ์˜ค๋ฅ˜๊ฐ€ ๋ฐœ์ƒํ•˜๊ฑฐ๋‚˜ ๊ธฐํƒ€ ๋ฌธ์˜ ์‚ฌํ•ญ์ด ์žˆ์„ ๊ฒฝ์šฐ, recruit@42dot.ai๋กœ ๋ฌธ์˜ํ•ด ์ฃผ์‹œ๊ธฐ ๋ฐ”๋ž๋‹ˆ๋‹ค.

  • ๊ตญ๊ฐ€๋ณดํ›ˆ๋Œ€์ƒ์ž ๋ฐ ์ทจ์—…๋ณดํ˜ธ ๋Œ€์ƒ์ž๋Š” ๊ด€๊ณ„๋ฒ•๋ น์— ๋”ฐ๋ผ ์šฐ๋Œ€ํ•ฉ๋‹ˆ๋‹ค.

  • ์žฅ์• ์ธ ๊ณ ์šฉ ์ด‰์ง„ ๋ฐ ์ง์—…์žฌํ™œ๋ฒ•์— ๋”ฐ๋ผ ์žฅ์• ์ธ ๋“ฑ๋ก์ฆ ์†Œ์ง€์ž๋ฅผ ์šฐ๋Œ€ํ•ฉ๋‹ˆ๋‹ค.

  • 42dot์€ ์˜๋ขฐํ•˜์ง€ ์•Š์€ ์„œ์น˜ํŽŒ์˜ ์ด๋ ฅ์„œ๋ฅผ ๋ฐ›์ง€ ์•Š์œผ๋ฉฐ, ์š”์ฒญํ•˜์ง€ ์•Š์€ ์ด๋ ฅ์„œ์— ๋Œ€ํ•ด ์ˆ˜์ˆ˜๋ฃŒ๋ฅผ ์ง€๋ถˆํ•˜์ง€ ์•Š์Šต๋‹ˆ๋‹ค.

  • ์ง€์›์„œ ๋‚ด์šฉ ์ค‘ ํ—ˆ์œ„ ์‚ฌ์‹ค์ด ๋ฐœ๊ฒฌ๋  ๊ฒฝ์šฐ, ์ž…์‚ฌ๊ฐ€ ์ทจ์†Œ๋  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

  • ์ธํ„ฐ๋ทฐ ํ”„๋กœ์„ธ์Šค ์ข…๋ฃŒ ํ›„ ์ง€์›์ž์˜ ๋™์˜ํ•˜์— ํ‰ํŒ์กฐํšŒ๊ฐ€ ์ง„ํ–‰๋  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

  • 3๊ฐœ์›”์˜ ์ˆ˜์Šต๊ธฐ๊ฐ„์ด ์ ์šฉ๋  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

LLM Engineer (Optimization) ยท 42dot

Auto apply with Likeremote