V
Aug 10, 2026VKAE Inference Acceleration: 23.4 MoE Throughput on a Single GPU Without Retraining
VIDRAFT의 VKAE는 재학습 없이 MoE 모델 추론 속도를 최대 23.4배 높이는 서빙 레이어 최적화 솔루션입니다. B200 단일 GPU에서 검증된 성능, FINAL-Bench로 재현 가능한 벤치마크 공개.
Aug 10, 20264 min read0 reactions0 comments