Opis techniczny: hybrydowa architektura agentowej AI z wykorzystaniem Nemotron 3.5 Lightning i NeMo Switchyard

1. Przegląd systemu: podejście „System of Models”
Nowoczesna agentowa AI wymaga odejścia od wdrażania pojedynczych, monolitycznych modeli na rzecz architektury „System of Models”. W takim podejściu agenty realizują złożone procesy obejmujące obserwację, planowanie, działanie, ocenę wyników i powtarzanie kolejnych kroków. Żaden pojedynczy model bazowy nie sprawdza się najlepiej we wszystkich tych zadaniach. Dlatego największą wydajność i dokładność można osiągnąć, kierując konkretne zadania do wyspecjalizowanych modeli, a najbardziej zaawansowane modele wykorzystując wyłącznie do złożonego rozumowania.
Najważniejsze korzyści architektury:
- Wyższa dokładność: wykorzystanie możliwości najlepiej dopasowanego modelu na każdym etapie procesu.
- Większa wydajność: mniejsze, wyspecjalizowane modele obsługują dużą liczbę typowych zadań, natomiast najbardziej zaawansowane modele są wykorzystywane tam, gdzie potrzebne jest bardziej złożone rozumowanie.
- Mniejsze opóźnienia: krótszy czas odpowiedzi w wieloetapowych procesach realizowanych przez agentową AI.
- Bezpieczeństwo i suwerenność danych: konfigurowalne reguły routingu pozwalają ściśle określić, gdzie mogą być przetwarzane poufne dane, takie jak informacje o klientach, dane finansowe czy własnościowy kod źródłowy.
2. NVIDIA Nemotron 3.5 Lightning
NVIDIA Nemotron 3.5 Lightning pełni w tej architekturze rolę wydajnego, lokalnego silnika inferencyjnego, zaprojektowanego do obsługi dużej liczby zadań agentowych bez konieczności korzystania z chmury.
Architektura i możliwości modelu:
- Architektura: Mixture-of-Experts (MoE) z 30 miliardami parametrów łącznie, przy czym dla każdego tokenu aktywne są tylko 3 miliardy parametrów.
- Pochodzenie: model został poddany destylacji na bazie zaawansowanego modelu NVIDIA Nemotron 3 Ultra, aby zachować możliwości agentowe przy znacznie mniejszych wymaganiach.
- Optymalizacja: zaprojektowany z myślą o popularnych środowiskach agentowych; oferuje wysoką dokładność w programowaniu, wywoływaniu narzędzi, wykonywaniu instrukcji oraz wieloetapowych procesach konwersacyjnych.
- Możliwość dostosowania: model jest w pełni otwarty i konfigurowalny, dzięki czemu organizacje mogą dodatkowo trenować go na własnych danych i dostosowywać do konkretnych zastosowań.
Docelowe platformy sprzętowe:
Model został zaprojektowany z myślą o lokalnym wdrożeniu, zapewniającym kontrolę nad danymi i niskie opóźnienia podczas inferencji:
- MSI EdgeXpert oparty na NVIDIA DGX Spark (GB10)
- MSI XpertStation WS300 oparty na NVIDIA DGX Station (GB300)
- Możliwość skalowania do NVIDIA DGX SuperPOD (H100/B200) w środowiskach hybrydowych.
3. NVIDIA NeMo Switchyard
NVIDIA NeMo Switchyard jest warstwą orkiestracji umożliwiającą wykorzystanie architektury „System of Models” poprzez automatyczne kierowanie zadań do odpowiednich modeli.
Najważniejsze funkcje:
- Automatyczny routing: otwartoźródłowa biblioteka routingu, która wybiera najlepszy dostępny model dla każdego etapu pracy agenta z puli zdefiniowanej przez użytkownika, obejmującej zarówno modele zamknięte, jak i otwarte.
- Uruchomienie bez skomplikowanej konfiguracji: wbudowane algorytmy routingu działają od razu, bez konieczności posiadania danych treningowych, dodatkowego dostrajania czy rozbudowanej konfiguracji.
- Automatyczne doskonalenie: model routingu z czasem staje się coraz skuteczniejszy. Dane z pracy agentów są wykorzystywane do poprawy decyzji dotyczących routingu bez konieczności ręcznego ponownego trenowania.
Sposoby integracji:
Rozwiązanie jest dostępne w ramach GitHub Early Access i może być integrowane na kilka sposobów:
- jako samodzielny serwer
- jako lekka biblioteka Python
- bezpośrednio w środowisku agentowym, np. za pośrednictwem bram LLM lub ISP.
4. Logika działania
Integracja Nemotron 3.5 Lightning i NeMo Switchyard opiera się na pętli routingu wykorzystującej informacje o aktualnym zadaniu:
- Obserwacja: agent otrzymuje kolejne zadanie, np. związane z planowaniem, programowaniem lub weryfikacją.
- Ocena: NeMo Switchyard analizuje kontekst zapytania i porównuje go z możliwościami dostępnych modeli.
- Decyzja o routingu:
- Zadania wyspecjalizowane lub realizowane na dużą skalę: są kierowane do lokalnego Nemotron 3.5 Lightning, zapewniającego wysoką wydajność i prywatność, np. przy rutynowej klasyfikacji lub ekstrakcji danych.
- Zadania wymagające złożonego rozumowania: są kierowane do najbardziej zaawansowanych modeli, gdy możliwości wyspecjalizowanego modelu okazują się niewystarczające.
- Wykonanie i informacja zwrotna: wybrany model przetwarza zadanie, a dane dotyczące jego działania trafiają z powrotem do Switchyard, pomagając ulepszać kolejne decyzje dotyczące routingu.
5. Zastosowania w różnych branżach
Ta hybrydowa architektura jest przeznaczona przede wszystkim do zastosowań, w których stale działające agenty wymagają niezawodnej i przewidywalnej inferencji:
- Osobiści asystenci: lokalne zarządzanie pocztą e-mail, kalendarzem, projektami i rezerwacjami na platformach DGX Spark/RTX Spark.
- Tworzenie oprogramowania: podsumowywanie PR, klasyfikacja kodu oraz analiza i priorytetyzacja testów.
- Usługi finansowe: ekstrakcja danych z dokumentów, sprawdzanie zgodności z regułami i politykami, monitorowanie sygnałów ryzyka oraz generowanie podsumowań.
- Cyberbezpieczeństwo: wzbogacanie danych dotyczących alertów, klasyfikacja incydentów, przeszukiwanie logów, weryfikacja zabezpieczeń oraz przygotowywanie wyników analiz.
- Telekomunikacja i opieka zdrowotna: analiza i priorytetyzacja alarmów sieciowych oraz obsługa zapytań dotyczących rozliczeń w telekomunikacji; automatyzacja planowania, rozliczeń i standardowej komunikacji w administracji ochrony zdrowia.
6. Efekty wydajnościowe i przykłady wdrożeń
Wdrożenia produkcyjne wykorzystujące tę architekturę routingu wykazały znaczące obniżenie kosztów i poprawę wydajności:
- Harvey Legal: obniżenie kosztów inferencji modeli ponad 10-krotnie dzięki połączeniu Switchyard z dodatkowymi trenowanymi modelami Nemotron dostosowanymi do zastosowań prawnych.
- Applied Compute: zmniejszenie całkowitych kosztów wykorzystania modeli o 25% przy zachowaniu dokładności na poziomie najbardziej zaawansowanych modeli w benchmarkach SWE-bench Verified dzięki inteligentnemu routingowi.
Architektura ta zmienia podejście do wdrażania AI: zamiast koncentrować się na zakupie klastrów GPU, organizacje mogą wdrażać modułowe, zoptymalizowane systemy programowe, które z czasem są w stanie automatycznie poprawiać sposób swojego działania.