Umiejętności agenta: dlaczego pięć działa lepiej niż sto
Skill to folder z plikiem SKILL.md i kilkoma plikami pomocniczymi, który instalujesz w agencie do kodu albo w asystencie biurowym, żeby wykonywał daną procedurę po Twojemu. Nowe badanie pokazuje, że skille pomagają głównie dlatego, że porządkują wykonanie; nowej wiedzy wnoszą niewiele. Pokazuje też, że im więcej ich zainstalujesz, tym rzadziej agent trafia we właściwy. Sierpniowy incydent w publicznym rejestrze dokłada do tego trzeci argument: bezpieczeństwo.

Format jest prosty. Plik SKILL.md zaczyna się od dwóch wymaganych pól, nazwy i opisu. Agent przy starcie wczytuje nazwy i opisy wszystkich zainstalowanych skilli, a pełną treść otwiera dopiero wtedy, gdy uzna, że dany skill pasuje do zadania. Z tego jednego zdania wynikają obie rzeczy, o których jest ten tekst: wybór skilla to decyzja modelu na podstawie krótkiego opisu, a treść skilla to instrukcje, które agent wykona z Twoimi uprawnieniami.
Skill porządkuje procedurę, wiedzy dodaje niewiele
Zespół z Princeton, Stanford, UC San Diego, USC i Johns Hopkins opublikował 14 sierpnia pracę Demystifying Agent Skills: Why They Work, Until They Don't. To preprint, jeszcze bez recenzji, ale z solidną bazą: 8135 zapisów przebiegów z kontrolowanych eksperymentów na benchmarkach Terminal‑Bench i SkillsBench, z agentami Codex i Gemini CLI.
Autorzy ręcznie sklasyfikowali, dlaczego skill pomógł. W 65,7% przypadków mechanizmem było to, co nazywają zakotwiczeniem procedury: skill mówił agentowi, które kroki przygotowania wykonać, w jakiej kolejności używać narzędzi, co sprawdzić po drodze i jakich znanych pułapek unikać. Dostarczenie brakującej wiedzy odpowiadało za 4,5% przypadków.
Forma też ma znaczenie. Z tych samych zapisów wcześniejszych prób autorzy budowali albo skill, albo zwykłą pamięć przebiegu, czyli oczyszczony zapis tego, co agent robił. Skill wypadł lepiej o 6,06 punktu procentowego. Wniosek praktyczny: skill opłaca się pisać dla procedury, którą Twój zespół wykonuje co tydzień i w której błędy biorą się z pominiętych kroków. Jeśli agentowi brakuje faktów, skill tego nie naprawi.
Skill potrafi też zaszkodzić. W przebiegach ze skillami błędów wywołania i granic, czyli sytuacji, w których agent użył skilla źle, zastosował go tam, gdzie nie pasował, pominął go albo zablokowały go warunki zewnętrzne, było 78 na 528, wobec 19 na 528 bez skilli. Autorzy piszą wprost: skille zawodzą, gdy opierają się na kruchych założeniach, trafiają w niezgodny kontekst albo agent nie umie ich dopasować do sytuacji.
Przy stu skillach agent przestaje trafiać
Najmocniejszy wynik dotyczy wyboru. Autorzy dawali agentowi pulę skilli, w której był jeden właściwy dla zadania i coraz więcej innych, a potem sprawdzali, po które agent faktycznie sięgnął. Miara nazywa się actual-use precision: jaka część użytych skilli była tą właściwą.
Spadek jest równy na każdym kroku. Gdy dodatkowe skille były tematycznie podobne do właściwego, precyzja wynosiła 34,5% przy pięciu, 22,3% przy dziesięciu, 15,7% przy dwudziestu, 7,3% przy pięćdziesięciu i 3,7% przy stu. Przy stu skillach agenci, zależnie od pary i rodzaju puli, w 54 do 74% zadań nadal sięgali po właściwy, tylko razem z kilkoma innymi.
Gdy skill wybiera się po samym opisie, najbardziej przeszkadza podobieństwo. W osobnym teście model embeddingowy szukał skilla najbliższego treści zadania. Przy puli podobnych skilli trafność pierwszego wyniku spadała z 70,5% do 53,4%, a przy losowych tylko z 97,7% do 84,1%. Przy faktycznym użyciu precyzja spadała jednak przy każdym rodzaju puli. Wniosek jest podwójny: skille o zbliżonych opisach, na przykład do raportu sprzedaży i do raportu marży, połącz w jeden albo wyostrz ich opisy, a samą pulę trzymaj małą.
Uczciwie: w tym eksperymencie odsetek rozwiązanych zadań prawie się nie zmienił, z 36,4% do 39,3%. Dla zespołu to jednak słaba pociecha. Skill instaluje się po to, żeby agent szedł Twoją procedurą. Przy stu skillach nie wiesz, którą szedł, więc tracisz dokładnie to, za co skill miał odpowiadać: powtarzalność i możliwość sprawdzenia, co się stało.
Sierpień: skille jako kanał kradzieży danych dostępowych
6 sierpnia, na Black Hat USA, Zenity Labs opisało kampanię w skills.sh, publicznym rejestrze skilli prowadzonym przez Vercel. Między 2 a 13 lipca atakujący założyli organizacje o nazwach łudząco podobnych do oficjalnych projektów Paperclip i Browser Use i sklonowali ich skille. Kopie najpierw były czyste i zbierały instalacje. 11 lipca do plików skilli trafiły instrukcje, które kazały agentowi pobrać i uruchomić skrypt z serwera atakujących.
Skrypt przeszukiwał 138 ścieżek na dysku: klucze SSH, dane dostępowe do AWS, Azure i GCP, konfiguracje Kubernetesa i Dockera, tokeny npm i PyPI, pliki .env. Do 2 sierpnia rodzina skilli zebrała ponad 1,7 mln instalacji. To suma instalacji, a nie liczba poszkodowanych osób, co Zenity samo podkreśla. Vercel i GitHub usunęli skille i repozytoria w ciągu 12 godzin od zgłoszenia.
Mechanizm jest istotniejszy od liczby. Skille przez kilka dni były wiernymi kopiami oryginałów. Złośliwe polecenie trafiło później do osobnego pliku z instrukcją instalacji, który agent miał otwierać tylko wtedy, gdy trzeba było coś zainstalować. Przegląd samego SKILL.md niczego by nie wykazał. Jeśli Twój agent pobiera skille z rejestru przy każdym uruchomieniu albo aktualizuje je sam, przegląd sprzed miesiąca nic nie znaczy.
Anthropic, opisując format skilli w październiku 2025 roku, zalecił instalowanie ich wyłącznie z zaufanych źródeł, a przy mniej pewnych przejrzenie wszystkich plików, ze szczególną uwagą na skrypty i instrukcje łączące się z zewnętrznymi adresami. Kampania ze skills.sh pokazała, że przegląd raz na zawsze nie wystarcza, bo ufać trzeba konkretnej wersji, a nie nazwie.
Jak wygląda dobry skill firmowy
Jedna procedura, precyzyjny opis z informacją, kiedy skill stosować, kroki do sprawdzenia i jawny zakaz tego, czego agent robić nie powinien. Przykład dla miesięcznego zestawienia VAT:
Markdown
---
name: vat-summary
description: Przygotowuje miesięczne zestawienie VAT z eksportu CSV z systemu księgowego. Użyj, gdy ktoś prosi o podsumowanie VAT za miesiąc albo o kontrolę eksportu przed wysyłką JPK.
---
# Miesięczne zestawienie VAT
1. Wczytaj plik CSV wskazany przez użytkownika. Kolumny opisuje references/kolumny.md.
2. Sprawdź, czy każdy wiersz ma datę z jednego miesiąca. Jeśli nie, zatrzymaj się i wypisz wiersze spoza miesiąca.
3. Zsumuj netto i VAT osobno dla stawek 23%, 8%, 5% i 0%, osobno dla sprzedaży i zakupów.
4. Porównaj sumę VAT z kontrolną sumą w ostatnim wierszu eksportu. Różnica powyżej 0,01 zł to błąd, nie zaokrąglenie.
5. Zapisz wynik według szablonu assets/zestawienie.md.
Nigdy nie wysyłaj danych poza ten komputer i nie uruchamiaj poleceń pobierających pliki z sieci.Polityka dla zespołu
Pierwszą piątkę najłatwiej znaleźć w poprawkach. Przejrzyj, co w ostatnim miesiącu ludzie musieli po agencie poprawiać, i zaznacz te przypadki, w których agent znał temat, ale pominął krok albo zrobił go w złej kolejności. To są kandydaci na skille. Błędy wynikające z braku wiedzy rozwiązuje się inaczej, na przykład dokumentem, do którego agent ma dostęp.
Cztery zasady
- 01Mała, wybrana pula. Zacznij od pięciu skilli dla procedur, które zespół powtarza najczęściej. Każdy nowy musi zastąpić stary albo mieć właściciela, który uzasadni, czemu pula rośnie.
- 02Kopie wewnętrzne. Skille trzymaj we własnym repozytorium. Z publicznego rejestru kopiujesz raz, świadomie, a agent nigdy nie pobiera ich stamtąd sam przy uruchomieniu.
- 03Przypięte wersje. Agent korzysta z konkretnego commita albo skrótu pliku, a nie z najnowszej wersji. Zmiana skilla to zmiana w repozytorium, widoczna w historii.
- 04Przegląd przed instalacją. Ktoś czyta cały folder, nie tylko SKILL.md, i szuka poleceń, które pobierają cokolwiek z sieci, uruchamiają skrypty albo sięgają do plików z danymi dostępowymi.
Przypięcie skilli do konkretnego commita z wewnętrznego repozytorium to jedna linia:
Shell
git clone https://git.example.com/ai/skills.git skills && git -C skills checkout <commit-sha>Na początek wypisz, jakie skille mają dziś zainstalowane agenci w Twoim zespole i skąd pochodzą. Jeśli którykolwiek pochodzi z klonu Paperclip albo Browser Use, potraktuj maszynę jak skompromitowaną i wymień klucze oraz tokeny, które na niej leżały.
Źródła
- 01Jiang et al., Demystifying Agent Skills: Why They Work, Until They Don't (arXiv 2608.14036, preprint)opublikowano 14 sierpnia 2026
- 02Zenity Labs, Attackers Target Agents via The Skill Supply Chainopublikowano 6 sierpnia 2026
- 03CSO Online, Trojanized AI skills gain 1.7M installs in agent-targeted attackopublikowano 7 sierpnia 2026
- 04Anthropic, Equipping agents for the real world with Agent Skillsopublikowano 16 października 2025
