Zagadnienie tego, w jaki sposób agent AI podejmuje kolejne decyzje, sięga samego rdzenia jego architektury. U podstaw leży tak zwana pętla odbieranie–układanie planu–wykonywanie, w której program najpierw rejestruje informacje z otoczenia, następnie analizuje dostępne możliwości, a wreszcie wykonuje wybraną akcję. Cały ten obieg odtwarza się wielokrotnie, aż do uzyskania zamierzonego efektu.
Sercem tego procesu jest model językowy, który pełni rolę wewnętrznego głosu doradczego agenta. To on odczytuje polecenia użytkownika, rozbija złożone zadanie na mniejsze podzadania i proponuje kolejność ich realizacji. Otoczenie modelu stanowią pomocnicze narzędzia – wyszukiwarki, kalkulatory, interfejsy API – które agent uruchamia wtedy, gdy wymaga precyzyjnych danych spoza swojej pamięci treningowej.
Interesującym elementem architektury jest tak zwana pamięć operacyjna, w której agent przechowuje tło bieżącego zadania. Dzięki niej nie traci nici nawet wtedy, gdy procedura rozciąga się na wiele etapów i potrzebuje przełączania między różnymi źródłami informacji. To dokładnie ta umiejętność odróżnia agenta od podstawowego skryptu, który odtwarza jedynie wcześniej ustaloną listę poleceń.
Oddzielną sprawą pozostaje mechanizm oceny własnych działań. Odpowiednio skonstruowany agent jest w stanie zidentyfikować, że otrzymany wynik odbiega od oczekiwanego, i cofnąć się do poprzedniego etapu, by podjąć próbę innej ścieżki. Taka samokorekta przybliża działanie maszyny do ludzkiego zwyczaju weryfikowania własnej pracy przed jej oddaniem.