Zhaoyuan He

Zhaoyuan He는 NVIDIA TensorRT 팀의 시니어 딥러닝 소프트웨어 엔지니어로, 대규모 언어 모델을 위한 효율적인 GPU 추론을 전문으로 합니다. 커널 개발, 그래프 최적화, 런타임 실행, 양자화, 집단 통신 최적화를 활용한 분산 추론 등 현대적인 추론 프레임워크의 성능을 높이는 기술을 폭넓게 연구하고 있습니다. 이러한 기술을 고도화해 NVIDIA 플랫폼에서 엔드투엔드 LLM 서빙의 처리량을 높이고 지연 시간을 줄이는 데 집중하고 있습니다. The University of Texas at Austin에서 컴퓨터과학 박사 학위를, University of California, San Diego에서 전기컴퓨터공학 석사 학위를 받았습니다.

Posts by Zhaoyuan He

Agentic AI / Generative AI

NVIDIA Dynamo-Triton의 NVIDIA TensorRT Multi-Device 연동을 통한 다중 GPU 모델 서빙 단순화

생성형 AI의 연산 및 메모리 요구량은 단일 GPU가 제공할 수 있는 수준을 지속적으로 뛰어넘고 있습니다. 5 MIN READ