ODBIERZ TWÓJ BONUS :: »

LLM w środowisku produkcyjnym. Serwowanie, optymalizacja i hosting na dużą skalę Chi Wang, Peiheng Hu

LLM w środowisku produkcyjnym. Serwowanie, optymalizacja i hosting na dużą skalę Chi Wang, Peiheng Hu - okladka książki

LLM w środowisku produkcyjnym. Serwowanie, optymalizacja i hosting na dużą skalę Chi Wang, Peiheng Hu - okladka książki

Autorzy:
Chi Wang, Peiheng Hu
Wydawnictwo:
Helion
Ocena:
Stron:
341
Druk:
oprawa miękka

Wdrażaj i optymalizuj modele LLM szybko, tanio i na dużą skalę

Rewolucja sztucznej inteligencji sprawiła, że duże modele językowe (LLM) z ciekawostek badawczych stały się krytyczną infrastrukturą produkcyjną. Obecnie największym wyzwaniem dla firm IT nie jest już samo trenowanie modeli, ale ich wydajne, bezpieczne i opłacalne wdrażanie. W erze agentów AI i w obliczu rosnących kosztów korzystania z publicznych API organizacje coraz częściej decydują się na hosting własnych rozwiązań. Ta książka stanowi kompleksowy przewodnik po serwowaniu i optymalizacji LLM. Wypełnia lukę między teorią a praktyką, pokazując, jak przekuć potężne modele w niezawodne aplikacje działające w czasie rzeczywistym, a przy tym poradzić sobie z nową fizyką i ekonomią generatywnej sztucznej inteligencji.

Ta publikacja krok po kroku przeprowadza czytelnika przez cykl życia modelu w środowisku produkcyjnym. Autorzy demistyfikują architekturę transformerów, szczegółowo omawiając fazy wstępnego wypełniania (prefill) i dekodowania, jak również zarządzanie pamięcią podręczną KV. Książka uczy projektowania systemów dla pojedynczych i wielu modeli, a także wdrażania zaawansowanych technik optymalizacji: ciągłego przetwarzania wsadowego, kwantyzacji, dekodowania spekulatywnego czy buforowania prefiksów. Czytelnik dowie się, jak skutecznie używać nowoczesnych frameworków (w tym vLLM, TensorRT-LLM, SGLang, llama.cpp) i jak skalować infrastrukturę na wiele procesorów graficznych (GPU) i węzłów przy zachowaniu idealnego balansu między przepustowością, opóźnieniami a kosztami operacyjnymi.

Najważniejsze zagadnienia:

  • Architektura LLM i mechanizmy generowania tokenów
  • Zarządzanie pamięcią KV i ciągłe przetwarzanie wsadowe
  • Projektowanie systemów serwowania
  • Zaawansowana optymalizacja
  • Skalowanie na wiele GPU
  • Przegląd frameworków: vLLM, TensorRT-LLM, SGLang, llama.cpp

Gdy duże modele językowe stają się podstawą nowoczesnych platform sztucznej inteligencji, ta książka oferuje praktyczny plan serwowania i optymalizacji modeli LLM na dużą skalę co umożliwia niezawodną i opłacalną obsługę ogromnych obciążeń.

Bhavesh Doshi, wicedyrektor działu chmury AI w Salesforce

Wybrane bestsellery

O autorach książki

Chi Wang dyrektor do spraw inżynierii w dziale Einstein AI w Salesforce. Ma ponad 18-letnie doświadczenie w zakresie AI i systemów rozproszonych. Kieruje rozwojem wielkoskalowych platform AI, jest autorem 12 patentów.

Peiheng Hu inżynier specjalizujący się w inferencji LLM w NVIDIA. Absolwent Harvardu i Georgia Tech. Od ponad dekady tworzy rozproszone systemy AI. Wcześniej pracował dla Salesforce i Microsoft Azure.

Helion - inne książki

Zamknij

Przenieś na półkę
Dodano produkt na półkę
Usunięto produkt z półki
Przeniesiono produkt do archiwum
Przeniesiono produkt do biblioteki

Zamknij

Wybierz metodę płatności

Płatności obsługuje:
Ikona płatności Alior Bank Ikona płatności Apple Pay Ikona płatności Bank PEKAO S.A. Ikona płatności Bank Pocztowy Ikona płatności Banki Spółdzielcze Ikona płatności BLIK Ikona płatności Crédit Agricole e-przelew Ikona płatności dawny BNP Paribas Bank Ikona płatności Google Pay Ikona płatności ING Bank Śląski Ikona płatności Inteligo Ikona płatności iPKO Ikona płatności mBank Ikona płatności Millennium Ikona płatności Nest Bank Ikona płatności Paypal Ikona płatności PayPo | PayU Płacę później Ikona płatności PayU Płacę później Ikona płatności Plus Bank Ikona płatności Płacę z Getin Bank Ikona płatności Płać z BOŚ Ikona płatności Płatność online kartą płatniczą Ikona płatności Santander Ikona płatności Visa Mobile