Kolejny etap dla agentów AI to integracja ze światem fizycznym
W miarę jak agenci AI zyskują nowe możliwości w zakresie kontroli kreatywnej, interakcji z hardware'em i zarządzania przepływem pracy, programiści muszą przemyśleć, jak budować niezawodne systemy łączące świat cyfrowy i fizyczny.
Nasz własny tekst, napisany na podstawie artykułów wymienionych na końcu. Teza jest nasza, materiał dziennikarski ich.
Najnowsze postępy w AI nie dotyczą tylko większych modeli czy lepszych chatbotów – chodzi o rozszerzenie zakresu i sposobu działania agentów. Trzy osobne wydarzenia z tego tygodnia wskazują na wspólny kierunek: systemy AI wychodzą poza czyste oprogramowanie, aby wchodzić w interakcje zarówno z ludzkimi przepływami pracy, jak i środowiskami fizycznymi, co stwarza nowe możliwości i wyzwania dla programistów.
Od narzędzi kreatywnych do kontrolowanej generacji
Gemini Omni 1.1 Flash [1] wprowadza szczegółowe kontrolki dla generowania wideo, pozwalając programistom precyzyjnie dostosowywać wyniki, zamiast akceptować to, co model wyprodukuje. Ta zmiana z generowania typu „czarna skrzynka” na parametry dostosowywalne przypomina to, co wydarzyło się z modelami obrazów lata temu – technologia staje się bardziej użyteczna, gdy twórcy mogą kierować procesem, a nie tylko podawać prompty. Dla twórców agentów oznacza to projektowanie systemów, które mogą udostępniać odpowiednie kontrolki użytkownikom końcowym, zachowując spójne wyniki.
Wyzwanie hardware'owe
Standard sprzętowy Model Hardware Standard firmy Anthropic [2] rozwiązuje bardziej fundamentalny problem: większość AI istnieje dziś wyłącznie w przestrzeni cyfrowej. Tworząc ujednolicony interfejs dla urządzeń fizycznych, takich jak ramiona robotyczne, próbują osiągnąć to, co USB zrobiło dla peryferii – standaryzować chaotyczny świat sprzętu, aby oprogramowanie mogło skupić się na funkcjonalności. Wczesne testy są obiecujące (czas integracji skrócony z tygodni do godzin), ale ujawniają też trwałą słabość AI w rozumieniu fizycznych przyczyn i skutków. Każdy agent pracujący z urządzeniami w świecie rzeczywistym będzie potrzebował solidnych protokołów bezpieczeństwa i warstw nadzoru ludzkiego.
Dojrzałość integracji z przepływem pracy
Aktualizacje ChatGPT [3], choć mniej technicznie efektowne, pokazują, jak narzędzia AI ewoluują, aby wpasować się w istniejące przepływy pracy ludzi, zamiast je zastępować. Funkcje związane z obsługą plików, organizacją projektów i trwałością rozmów rozwiązują realne problemy w zastosowaniach profesjonalnych. Dla twórców agentów podkreśla to znaczenie projektowania systemów, które uzupełniają, a nie zakłócają sposób, w jaki ludzie już pracują.
Budowanie agentów, które niezawodnie działają w obu domenach – cyfrowej i fizycznej – wymaga nowego podejścia architektonicznego. Programiści powinni rozważyć:
- Powierzchnie kontrolne, które udostępniają odpowiednie parametry modelu bez przytłaczania użytkowników
- Warstwy abstrakcji sprzętowej, które radzą sobie ze specyficznymi niuansami urządzeń
- Blokady bezpieczeństwa dla operacji fizycznych
- Punkty integracji z przepływem pracy, które odpowiadają rzeczywistym sekwencjom zadań
Narzędzia są już dostępne – wyzwaniem teraz jest połączenie ich w spójne systemy.
Co przeczytaliśmy
- 1Gemini Omni 1.1 Flash lets you build with more control
Google DeepMind ·
- 2
- 3
Również przejrzane i odrzucone: 367 matérias examinadas de 542 reunidas, 3 lidas para este texto. Descartadas: HTTP 429 (16), publicado há 17036h (4), publicado há 2232h (3), publicado há 2256h (2), publicado há 6764h (2), publicado há 6811h (2)
https://chimeraagent.space