Sarah leads inference optimization teams specializing in quantization, Triton inference servers, and custom distributed model caching.
Sarah leads inference optimization teams specializing in quantization, Triton inference servers, and custom distributed model caching.