Back

Opis techniczny: hybrydowa architektura agentowej AI z wykorzystaniem Nemotron 3.5 Lightning i NeMo Switchyard

Hybrydowa architektura agentowej AI z wykorzystaniem Nemotron 3.5 Lightning i NeMo Switchyard

1. Przegląd systemu: podejście „System of Models”

Nowoczesna agentowa AI wymaga odejścia od wdrażania pojedynczych, monolitycznych modeli na rzecz architektury „System of Models”. W takim podejściu agenty realizują złożone procesy obejmujące obserwację, planowanie, działanie, ocenę wyników i powtarzanie kolejnych kroków. Żaden pojedynczy model bazowy nie sprawdza się najlepiej we wszystkich tych zadaniach. Dlatego największą wydajność i dokładność można osiągnąć, kierując konkretne zadania do wyspecjalizowanych modeli, a najbardziej zaawansowane modele wykorzystując wyłącznie do złożonego rozumowania.

Najważniejsze korzyści architektury:

  • Wyższa dokładność: wykorzystanie możliwości najlepiej dopasowanego modelu na każdym etapie procesu.
  • Większa wydajność: mniejsze, wyspecjalizowane modele obsługują dużą liczbę typowych zadań, natomiast najbardziej zaawansowane modele są wykorzystywane tam, gdzie potrzebne jest bardziej złożone rozumowanie.
  • Mniejsze opóźnienia: krótszy czas odpowiedzi w wieloetapowych procesach realizowanych przez agentową AI.
  • Bezpieczeństwo i suwerenność danych: konfigurowalne reguły routingu pozwalają ściśle określić, gdzie mogą być przetwarzane poufne dane, takie jak informacje o klientach, dane finansowe czy własnościowy kod źródłowy.

2. NVIDIA Nemotron 3.5 Lightning

NVIDIA Nemotron 3.5 Lightning pełni w tej architekturze rolę wydajnego, lokalnego silnika inferencyjnego, zaprojektowanego do obsługi dużej liczby zadań agentowych bez konieczności korzystania z chmury.

Architektura i możliwości modelu:

  • Architektura: Mixture-of-Experts (MoE) z 30 miliardami parametrów łącznie, przy czym dla każdego tokenu aktywne są tylko 3 miliardy parametrów.
  • Pochodzenie: model został poddany destylacji na bazie zaawansowanego modelu NVIDIA Nemotron 3 Ultra, aby zachować możliwości agentowe przy znacznie mniejszych wymaganiach.
  • Optymalizacja: zaprojektowany z myślą o popularnych środowiskach agentowych; oferuje wysoką dokładność w programowaniu, wywoływaniu narzędzi, wykonywaniu instrukcji oraz wieloetapowych procesach konwersacyjnych.
  • Możliwość dostosowania: model jest w pełni otwarty i konfigurowalny, dzięki czemu organizacje mogą dodatkowo trenować go na własnych danych i dostosowywać do konkretnych zastosowań.

Docelowe platformy sprzętowe:

Model został zaprojektowany z myślą o lokalnym wdrożeniu, zapewniającym kontrolę nad danymi i niskie opóźnienia podczas inferencji:


3. NVIDIA NeMo Switchyard

NVIDIA NeMo Switchyard jest warstwą orkiestracji umożliwiającą wykorzystanie architektury „System of Models” poprzez automatyczne kierowanie zadań do odpowiednich modeli.

Najważniejsze funkcje:

  • Automatyczny routing: otwartoźródłowa biblioteka routingu, która wybiera najlepszy dostępny model dla każdego etapu pracy agenta z puli zdefiniowanej przez użytkownika, obejmującej zarówno modele zamknięte, jak i otwarte.
  • Uruchomienie bez skomplikowanej konfiguracji: wbudowane algorytmy routingu działają od razu, bez konieczności posiadania danych treningowych, dodatkowego dostrajania czy rozbudowanej konfiguracji.
  • Automatyczne doskonalenie: model routingu z czasem staje się coraz skuteczniejszy. Dane z pracy agentów są wykorzystywane do poprawy decyzji dotyczących routingu bez konieczności ręcznego ponownego trenowania.

Sposoby integracji:

Rozwiązanie jest dostępne w ramach GitHub Early Access i może być integrowane na kilka sposobów:

  • jako samodzielny serwer
  • jako lekka biblioteka Python
  • bezpośrednio w środowisku agentowym, np. za pośrednictwem bram LLM lub ISP.

4. Logika działania

Integracja Nemotron 3.5 Lightning i NeMo Switchyard opiera się na pętli routingu wykorzystującej informacje o aktualnym zadaniu:

  • Obserwacja: agent otrzymuje kolejne zadanie, np. związane z planowaniem, programowaniem lub weryfikacją.
  • Ocena: NeMo Switchyard analizuje kontekst zapytania i porównuje go z możliwościami dostępnych modeli.
  • Decyzja o routingu:
    1. Zadania wyspecjalizowane lub realizowane na dużą skalę: są kierowane do lokalnego Nemotron 3.5 Lightning, zapewniającego wysoką wydajność i prywatność, np. przy rutynowej klasyfikacji lub ekstrakcji danych.
    2. Zadania wymagające złożonego rozumowania: są kierowane do najbardziej zaawansowanych modeli, gdy możliwości wyspecjalizowanego modelu okazują się niewystarczające.
  • Wykonanie i informacja zwrotna: wybrany model przetwarza zadanie, a dane dotyczące jego działania trafiają z powrotem do Switchyard, pomagając ulepszać kolejne decyzje dotyczące routingu.

5. Zastosowania w różnych branżach

Ta hybrydowa architektura jest przeznaczona przede wszystkim do zastosowań, w których stale działające agenty wymagają niezawodnej i przewidywalnej inferencji:

  • Osobiści asystenci: lokalne zarządzanie pocztą e-mail, kalendarzem, projektami i rezerwacjami na platformach DGX Spark/RTX Spark.
  • Tworzenie oprogramowania: podsumowywanie PR, klasyfikacja kodu oraz analiza i priorytetyzacja testów.
  • Usługi finansowe: ekstrakcja danych z dokumentów, sprawdzanie zgodności z regułami i politykami, monitorowanie sygnałów ryzyka oraz generowanie podsumowań.
  • Cyberbezpieczeństwo: wzbogacanie danych dotyczących alertów, klasyfikacja incydentów, przeszukiwanie logów, weryfikacja zabezpieczeń oraz przygotowywanie wyników analiz.
  • Telekomunikacja i opieka zdrowotna: analiza i priorytetyzacja alarmów sieciowych oraz obsługa zapytań dotyczących rozliczeń w telekomunikacji; automatyzacja planowania, rozliczeń i standardowej komunikacji w administracji ochrony zdrowia.

6. Efekty wydajnościowe i przykłady wdrożeń

Wdrożenia produkcyjne wykorzystujące tę architekturę routingu wykazały znaczące obniżenie kosztów i poprawę wydajności:

  • Harvey Legal: obniżenie kosztów inferencji modeli ponad 10-krotnie dzięki połączeniu Switchyard z dodatkowymi trenowanymi modelami Nemotron dostosowanymi do zastosowań prawnych.
  • Applied Compute: zmniejszenie całkowitych kosztów wykorzystania modeli o 25% przy zachowaniu dokładności na poziomie najbardziej zaawansowanych modeli w benchmarkach SWE-bench Verified dzięki inteligentnemu routingowi.

Architektura ta zmienia podejście do wdrażania AI: zamiast koncentrować się na zakupie klastrów GPU, organizacje mogą wdrażać modułowe, zoptymalizowane systemy programowe, które z czasem są w stanie automatycznie poprawiać sposób swojego działania.

Subskrybuj naszego bloga

Bądź na bieżąco w kwestii sprzętu, wskazówek i wiadomości.

Klikając tutaj, wyrażasz zgodę na przetwarzanie Twoich danych osobowych przez [Micro-Star International Co., LTD.] w celu przesyłania Ci informacji o [produktach, usługach i nadchodzących wydarzeniach MSI]. Należy pamiętać, że można zrezygnować z subskrypcji newsletterów MSI w tym miejscu w każdym momencie.

Dalsze szczegóły dotyczące naszych działań związanych z przetwarzaniem danych są dostępne w dokumencie Polityka prywatności MSI