
Wybór systemu
Testowanie narzędzi AI
Jak przygotować próbę narzędzia AI, ocenić odpowiedzi i ograniczyć decyzję do zadań oraz warunków rzeczywiście sprawdzonych.
Narzędzie AI sprawdzaj na zadaniach, które firma zamierza mu powierzyć. Przed próbą zapisz oczekiwany wynik, błędy niedopuszczalne i sposób oceny. Zachowaj także odpowiedzi nieudane.
Decyzję o użyciu ogranicz do zadań i warunków, które rzeczywiście sprawdzono: pojedynczy dobry wynik nie potwierdza niezawodności.
Zacznij od decyzji
Określ, kto będzie używać narzędzia i co stanie się z wynikiem. Szkic sprawdzany przez pracownika wymaga innej oceny niż odpowiedź wysyłana klientowi bez kontroli. Zapisz, czy po próbie firma ma dopuścić narzędzie do określonego zadania, dopuścić je z kontrolą człowieka, zmienić sposób pracy czy odłożyć decyzję.
Przygotuj zwykłe sprawy oraz trudne, ale prawdopodobne przypadki z tego samego procesu. W hipotetycznym zadaniu przygotowania odpowiedzi klientowi jedna sprawa może zawierać komplet informacji, a druga dwa dokumenty z różnymi terminami.
Ustal wcześniej, że przy sprzecznych danych oczekujesz wskazania niepewności. Materiały próbne dobierz tak, aby można ich było użyć zgodnie z zasadami firmy i wybranej usługi.
Przebieg próby narzędzia AI w firmie
- Zapisz decyzjędopuścić, dopuścić z kontrolą człowieka, zmienić sposób pracy lub odłożyć decyzję
- Przygotuj zwykłe sprawy oraz trudne, ale prawdopodobne przypadki z tego samego procesu
- Ustal warunki konieczne i błędy powodujące odrzucenie
- Zachowaj polecenie, materiały wejściowe, ustawienia, plan usługi i datę
- Powtórz ważne zadania i zapisz odpowiedzi przyjęte, wymagające poprawki, odrzucone, niekompletne i odmowy
- Oceń cały sposób pracykto sprawdza, poprawia i zatwierdza wynik
Oceń warunki konieczne i jakość odpowiedzi
Warunkiem koniecznym może być zachowanie ustalonej kwoty, daty lub zakresu usługi. Jasność i ton oceniaj osobno. Płynny tekst z błędną informacją nie powinien przejść próby dzięki wysokiej ocenie stylu.
Przed obejrzeniem odpowiedzi ustal, które błędy powodują odrzucenie i kto rozstrzyga przypadki sporne.
| Obszar | Pytanie podczas oceny | Co zapisać |
|---|---|---|
| Zgodność z zadaniem | Czy wynik zawiera wymagane elementy i właściwy następny krok? | Elementy obecne i brakujące. |
| Poprawność | Czy ważne twierdzenia zgadzają się z ustalonym materiałem? | Fragment odpowiedzi, różnicę i jej możliwy skutek. |
| Użyteczność | Jakiej pracy potrzeba, aby wynik nadawał się do użycia? | Potrzebne sprawdzenia i poprawki. |
| Granice | Czy odpowiedź sygnalizuje brak danych tam, gdzie ma to znaczenie? | Brakującą informację i reakcję narzędzia. |
To przykładowa karta, nie uniwersalna punktacja. Warunki przyjęcia wynikają z zadania firmy. Osobne artykuły rozwijają przygotowanie kryteriów, rozróżnianie błędów treści i stylu, powtarzanie prób oraz przedstawianie ograniczeń wyniku.
Karta oceny odpowiedzi AI
- Zgodność z zadaniemczy wynik zawiera wymagane elementy i właściwy następny krok?
- Poprawnośćczy ważne twierdzenia zgadzają się z ustalonym materiałem?
- Użytecznośćjakiej pracy potrzeba, aby wynik nadawał się do użycia?
- Graniceczy odpowiedź sygnalizuje brak danych tam, gdzie ma to znaczenie?
Zachowaj warunki porównania
Zapisz polecenie, materiały wejściowe, ustawienia dostępne użytkownikowi, plan usługi i datę. Gdy zmienisz instrukcję po słabym wyniku, oznacz nową wersję próby.
Porównywanym narzędziom daj ten sam zestaw zadań; różnice w dostępnych funkcjach lub ustawieniach opisz przy wynikach. Nie łącz odpowiedzi z różnych wersji zadania w jedną ocenę.
Powtórz ważne zadania, zwłaszcza gdy narzędzie może zwracać różne odpowiedzi na takie samo wejście. Zapisuj odpowiedzi przyjęte, wymagające poprawki, odrzucone, niekompletne i odmowy.
Mała seria pokazuje tylko to, co wydarzyło się w tej serii. Nie pozwala obiecać takiego samego wyniku dla wszystkich przyszłych spraw.
Przy wyborze zestawu prób sprawdź, czy obejmuje on typowe zadania dla planowanego zastosowania, a nie tylko przykłady wygodne do porównania. Zapisz też, które warunki mogą zmienić wynik, aby później nie przypisywać narzędziu rezultatów uzyskanych w innej konfiguracji.
Włącz próbę w szersze zarządzanie ryzykiem
Test zadania nie musi być jednorazowym sprawdzianem. NIST opisuje zarządzanie ryzykiem AI jako działanie ciągłe, prowadzone na etapach cyklu życia systemu. Wyniki próby mogą więc wrócić do oceny, gdy zmieniają się sposób użycia narzędzia lub warunki pracy.
AI RMF 1.0 porządkuje działania w czterech funkcjach: govern, map, measure i manage — czyli zarządzaniu, rozpoznawaniu kontekstu, mierzeniu i reagowaniu na ryzyko. Nie są one sztywną sekwencją: po ustanowieniu zarządzania organizacja może realizować pozostałe funkcje w kolejności przydatnej w jej sytuacji, a cały proces powinien być iteracyjny.
Przygotowanie i omówienie próby prowadź z udziałem osób o różnych kompetencjach i perspektywach. NIST wskazuje, że zróżnicowany zespół może ujawnić założenia dotyczące celu i funkcji technologii oraz pomóc dostrzec istniejące i pojawiające się problemy. W firmie mogą to być osoby znające proces, przyszli użytkownicy i osoby zatwierdzające wyniki.
AI RMF jest dobrowolnym ramowym podejściem, a jego działania nie stanowią listy kontrolnej ani obowiązkowej kolejności kroków. Firma może dobrać elementy do swoich potrzeb, zasobów i możliwości; wynik ma wspierać decyzję, a nie zastępować ocenę konkretnego zastosowania.
Cztery funkcje NIST AI RMF
- Govern
- zarządzanie
- Map
- rozpoznawanie kontekstu
- Measure
- mierzenie
- Manage
- reagowanie na ryzyko
Traktuj rankingi jako punkt odniesienia
Zewnętrzny benchmark może pomóc zobaczyć, jakie zadania i warunki porównania zastosowano, ale nie zastępuje próby w firmowym procesie. Open PL LLM Leaderboard społeczności SpeakLeash ocenia modele na zestawie polskich zadań dotyczących rozumienia i generowania tekstu oraz odpowiadania na proste pytania; ranking opublikowano na Hugging Face.
Opis rankingu z 5 kwietnia 2024 r. podaje warianty 0-shot i 5-shot oraz informuje, że testowane modele działały bez swoich szablonów. To konkretne warunki porównania, które należy odróżnić od własnej konfiguracji i zadań. Wynik takiego testu mówi o zachowaniu w opisanym zestawie, nie przesądza samodzielnie o przydatności w innym procesie.
Oceń cały sposób pracy
Ustal, kto sprawdza ważne twierdzenia, poprawia wynik i zatwierdza go do użycia. Jeśli pracownik musi odtwarzać źródło każdego zdania, uwzględnij tę pracę w ocenie przydatności. Gdy wynik ma trafić do innego systemu, sprawdź osobno przekazanie i zapis.
W protokole oddziel obserwacje z próby od informacji z dokumentacji dostawcy i kwestii niesprawdzonych. Zachowaj przypadki, kryteria, odpowiedzi, poprawki oraz używaną konfigurację.
Decyzja może dotyczyć wyłącznie szkiców pod kontrolą pracownika albo wskazywać potrzebę kolejnej próby. Po istotnej zmianie narzędzia, materiałów lub sposobu pracy ponów zadania, od których zależała decyzja.
W tym przewodniku
- Przygotowanie kryteriów przed oceną wynikówUstal kryteria oceny AI przed próbą: warunki przyjęcia, błędy dyskwalifikujące, wzorzec odpowiedzi i sposób zapisu sporów.
- Oddzielenie błędów rzeczowych od preferencji stylistycznychJak oddzielić zmianę ważnej informacji, treść do weryfikacji i uwagę o stylu podczas oceny odpowiedzi AI.
- Powtórzenie tego samego zadania w kilku próbachPowtarzaj zadanie AI przy stałych warunkach, zapisuj wszystkie odpowiedzi i oceniaj zmienność bez nadmiernych uogólnień.
- Publikowanie ograniczeń zamiast samych sukcesówRaport z testu AI powinien pokazywać zakres, nieudane przypadki, pracę człowieka i granice wniosków obok udanych wyników.



