Zagadnienie tego, w jaki sposób agent AI podejmuje kolejne decyzje, sięga samego serca jego architektury. U fundamentu leży tak zwana pętla percepcja–planowanie–działanie, w której program najpierw odbiera informacje z otoczenia, następnie analizuje dostępne możliwości, a wreszcie wykonuje wybraną akcję. Cały ten obieg odtwarza się kilkakrotnie, aż do osiągnięcia zamierzonego efektu.
Trzonem tego procesu jest model językowy, który pełni rolę wewnętrznego głosu konsultacyjnego agenta. To on odczytuje polecenia użytkownika, rozbija złożone zadanie na mniejsze podzadania i sugeruje kolejność ich wykonania. Środowisko modelu stanowią pomocnicze narzędzia – wyszukiwarki, kalkulatory, interfejsy API – które agent uruchamia wtedy, gdy wymaga precyzyjnych danych spoza swojej pamięci treningowej.
Ciekawym składnikiem architektury jest tak zwana pamięć robocza, w której agent przechowuje kontekst bieżącego zadania. Dzięki niej nie gubi nici nawet wtedy, gdy procedura rozkłada się na kilka etapów i wymaga przeskakiwania między różnymi źródłami informacji. To właśnie ta umiejętność odróżnia agenta od prostego skryptu, który odtwarza jedynie wcześniej ustaloną listę poleceń.
Osobną kwestią pozostaje mechanizm ewaluacji własnych działań. Dobrze zbudowany agent jest w stanie rozpoznać, że otrzymany wynik odbiega od oczekiwanego, i wrócić do poprzedniego etapu, by spróbować innej ścieżki. Taka autokorekta zbliża działanie maszyny do ludzkiego zwyczaju weryfikowania własnej pracy przed jej oddaniem.