High-Performance Inference Serving : Batching, Quantization, and Low-Latency Model Deployment.
Idioma: inglés
Editorial: Independently Published Jul 2026, 2026
- Tapa blanda
- Nuevo

Librería: AHA-BUCH GmbH, Einbeck, AlemaniaAHA-BUCH GmbH
Vendedor de AbeBooks desde 14 de agosto de 2006
Condición: Nuevo
EUR 79,45
Cantidad disponible: 2 disponibles
Añadir al carritoDescripción del artículo del vendedor
Neuware - Stop burning GPU compute on naive deployments. Transform your models into ultra-low-latency, high-throughput inference engines. Training a model is only the first step. Serving it in production, handling massive concurrent requests without bankrupting your infrastructure budget or bottlenecking your application is a hardcore systems engineering discipline. Standard Python wrappers and naive API servers collapse under enterprise loads. High-Performance Inference Serving is the definitive operational manual for architects and MLOps engineers scaling AI in production. We strip away the introductory data science and dive straight into the physics of model serving. You will master the bare-metal realities of the GPU memory wall, KV cache management, and hardware-sympathetic execution required to squeeze maximum throughput from modern accelerators.>Inside this manual, you will execute: >State-of-the-Art Compression: Shrinking massive models via PTQ workflows using GPTQ, AWQ, and SmoothQuant to drastically reduce memory bandwidth requirements. Speculative & Parallel Decoding: Slashing latency with draft models, Medusa, and Lookahead decoding to multiply token generation speed. Kernel-Level Optimization: Bypassing compiler-generated kernels to implement Operator Fusion and FlashAttention for zero-overhead memory round-trips. Enterprise Production Architecture: Containerizing inference engines like vLLM, TensorRT-LLM, and Triton, and deploying autoscaling Kubernetes architectures with strict observability SLOs. Who is this for >Stop over-provisioning hardware to compensate for poor architecture. Grab your copy and deploy at scale today.…
N° de ref. del artículo 9798188217280
- Título
- High-Performance Inference Serving : Batching, Quantization, and Low-Latency Model Deployment.
- Autor
- Elmer Robinson
- Editorial
- Independently Published Jul 2026
- Año de publicación
- 2026
- Estado
- Neu
- Encuadernación
- Taschenbuch
- Idioma
- inglés
- ISBN 13
- 9798188217280
- Peso del artículo
- 636 gramos
- Dimensiones
- 244x170x21 mm
Training a model is only the first step. Serving it in production, handling massive concurrent requests without bankrupting your infrastructure budget or bottlenecking your application is a hardcore systems engineering discipline. Standard Python wrappers and naive API servers collapse under enterprise loads.
High-Performance Inference Serving is the definitive operational manual for architects and MLOps engineers scaling AI in production. We strip away the introductory data science and dive straight into the physics of model serving. You will master the bare-metal realities of the GPU memory wall, KV cache management, and hardware-sympathetic execution required to squeeze maximum throughput from modern accelerators.
This playbook bridges the gap between model weights and enterprise infrastructure. From deploying state-of-the-art quantization techniques to orchestrating continuous batching and speculative decoding, this book provides the exact blueprints to deploy LLMs and multi-modal models at scale.
Inside this manual, you will execute:
Advanced Batching & Paged Memory: Treating GPU VRAM like virtual memory, deploying PagedAttention, and implementing continuous batching to maximize hardware utilization.
State-of-the-Art Compression: Shrinking massive models via PTQ workflows using GPTQ, AWQ, and SmoothQuant to drastically reduce memory bandwidth requirements.
Speculative & Parallel Decoding: Slashing latency with draft models, Medusa, and Lookahead decoding to multiply token generation speed.
Kernel-Level Optimization: Bypassing compiler-generated kernels to implement Operator Fusion and FlashAttention for zero-overhead memory round-trips.
Enterprise Production Architecture: Containerizing inference engines like vLLM, TensorRT-LLM, and Triton, and deploying autoscaling Kubernetes architectures with strict observability SLOs.
Who is this for?
This manual is engineered exclusively for Senior MLOps Engineers, AI Infrastructure Architects, Backend Systems Programmers, and Technical Leads. If you are responsible for lowering inference costs and crushing latency bottlenecks in production, this is your blueprint.
Stop over-provisioning hardware to compensate for poor architecture. Grab your copy and deploy at scale today.
“Sinopsis” puede pertenecer a otra edición de este título.
AHA-BUCH GmbH
Einbeck, Alemania
Vendedor de AbeBooks desde 14 de agosto de 2006
Tarifas de envío de Alemania a Estados Unidos de America
| Artículo | De 5 a 7 días hábiles | De 7 a 10 días hábiles |
|---|---|---|
| Primer artículo | EUR 30,50 | EUR 30,50 |
Métodos de pago
- Cheque
- Giro bancario
- PayPal
Descripción de la tienda
Das Unternehmen AHA-BUCH GmbH: Seit der Gründung von AHA-BUCH im Juli 2005 ist unser Hauptziel, zufriedenen Kunden so schnell und so preisgünstig wie möglich ihren Bücherwunsch zu erfüllen. Unsere Firma beschäftigt 16 Mitarbeiter, die nur ein Ziel kennen: den Kunden und seine Wünsche! Auf über 3700 m2 Fläche haben wir über 100.000 Bücher, Modernes Antiquariat und Spiele auf Lager.
Especialidad
Kinderbücher & Kinderhör Casetten, German Books, Software, Natur & Tiere, Ratgeber, Sachbücher, Englische Bücher, Medizin & Gesundheit, Universität & StudiumInformación empresarial del vendedor
AHA-BUCH GmbH
Garlebsen 48
Einbeck, Alemania 37574
Condiciones de venta
IImprint
Información del vendedor
AHA-BUCH GmbH
representado por el director gerente Christel Glass
Garlebsen 48
37574 Einbeck
Alemania
Teléfono: 055639996039
Fax: 055639995974
E-Mail: abebooks@aha-buch.de
USt-IdNr.: DE261904229
Inscrita en el Registro Mercantil Amtsgerichtes Göttingen
Handelsregisternummer HRB 200691
Resolución alternativa de conflictos:
La Comisión Europea proporciona una plataforma para la resolución extrajudicial de litigios en línea (plataforma ODR), a la que se puede acceder en https://ec.europa.eu/odr.
Somos miembros de la iniciativa "FairCommerce" desde el 25.05.2018.
Para obtener más información, consulte www.fair-commerce.de.
Derecho al desistimiento
Si es un consumidor, puede rescindir el contrato de acuerdo con lo siguiente. Por consumidor se entiende cualquier persona física que actúe con fines ajenos a su actividad comercial, empresarial, oficio o profesión.
Información sobre el derecho de desistimiento
Derecho legal de desistimiento
Tiene derecho a rescindir este contrato en un plazo de 14 días sin dar ningún motivo.
El periodo de desistimiento vencerá a los 14 días desde que usted, o un tercero que no sea el transportista e indicado por usted, adquiera la posesión física del último bien o del último lote o pieza.
Para ejercer el derecho de desistimiento, complete de forma electrónica y envíe una declaración clara en nuestro sitio web, desde "Mis compras" en "Mi cuenta". Le enviaremos sin demora un acuse de recibo de dicho desistimiento a través de un soporte duradero (por ejemplo, por correo electrónico).
Para cumplir con el plazo de desistimiento, basta con que envíe su comunicación relativa al ejercicio del derecho de desistimiento antes de que venza el periodo de desistimiento.
Efectos del desistimiento
Si rescinde este contrato, le reembolsaremos todos los pagos que hayamos recibido de usted, incluidos los gastos de envío (excepto los gastos adicionales que surjan si elige un tipo de envío que no sea el tipo de envío estándar más económico que ofrecemos).
Podemos hacer una deducción del reembolso por la pérdida de valor de cualquier bien suministrado, si la pérdida es el resultado de una manipulación innecesaria por su parte.
Efectuaremos el reembolso sin demoras indebidas y, a más tardar, 14 días después de que se nos informe de su decisión de rescindir este contrato.
Efectuaremos el reembolso utilizando el mismo medio de pago que utilizó para la transacción inicial, a menos que haya acordado expresamente lo contrario; en cualquier caso, no incurrirá en ningún cargo como resultado de dicho reembolso.
Podremos retener el reembolso hasta que hayamos recibido los bienes o hasta que nos haya presentado una prueba de que los ha devuelto, lo que ocurra primero.
Deberá devolver los bienes o entregarlos a AHA-BUCH GmbH, Einbeck, Germany, sin demoras indebidas y, en cualquier caso, en un plazo máximo de 14 días a partir del día en que nos comunique su desistimiento del presente contrato. El plazo se cumple si devuelve la mercancía antes de que venza el periodo de 14 días. Tendrá que asumir los gastos directos de devolución de los bienes. Usted solo es responsable de la disminución del valor de los bienes como resultado de una manipulación distinta a la necesaria para establecer la naturaleza, las características y el funcionamiento de los bienes.
Excepciones al derecho de desistimiento
El derecho de desistimiento no se aplica a lo siguiente:
- La entrega de periódicos, diarios o revistas, con la excepción de los contratos de suscripción; y
- El suministro de contenido digital que no se proporcione en un soporte tangible (por ejemplo, en un CD o DVD) si, al hacer el pedido, aceptó que podíamos empezar a entregarlo y que no podría desistir una vez iniciada la entrega.
Condiciones de envío
Enviamos su pedido después de recibirlos
para artículos disponibles las últimas 24 horas,
para artículos con suministro nocturno a más tardar 48 horas.
En caso de que necesitemos pedir un artículo a nuestro proveedor, nuestro tiempo de envío depende de la fecha de recepción de los artículos, pero los artículos se enviarán el mismo día.
Nuestro objetivo es enviar los artículos pedidos de la manera más rápida, pero también más eficiente y segura a nuestros clientes.