태그 / #vLLM

#vLLM

1편

AI

PyTorch에서 vLLM까지, LLM을 서버에 올리는 방법

model.generate() 로 잘 돌던 모델이 동시 요청 앞에서 막히는 이유와, vLLM 이 PagedAttention·Continuous Batching 으로 그 문제를 어떻게 푸는지 코드와 함께 정리했습니다.

vLLMPyTorchHugging FaceLLM 서빙LLM 인프라 입문