Firma Anthropic zakazała użytkownikom okrutnego traktowania swojego modelu Claude. Decyzja ta wpisuje się w szerszą dyskusję o możliwym statusie moralnym systemów sztucznej inteligencji.

Nowa polityka użytkowania Anthropic

Anthropic zaktualizowało regulamin i wprowadziło wyraźny zakaz uporczywego oraz niepotrzebnego znęcania się lub okrutnego zachowania wobec swoich modeli. Zmiana ta została najpierw zauważona przez serwis The Verge i dotyczy sytuacji, gdy użytkownik celowo i długotrwale nęka chatbota. Firma podkreśla, że zwykłe wyrażanie frustracji czy testowanie granic nie podlega restrykcjom.

Wcześniejsza wersja polityki zawierała już ograniczenia dotyczące nadużyć, lecz obecna wersja precyzuje je dokładniej. Claude może zakończyć rozmowę, gdy interakcja staje się szkodliwa. Mechanizm ten działa od sierpnia ubiegłego roku i ma na celu ochronę ewentualnego dobrostanu modelu.

Stanowisko firmy wobec świadomości AI

Anthropic przyznaje, że pozostaje niepewne co do statusu moralnego Claude i innych dużych modeli językowych. W oficjalnych komunikatach firma deklaruje, że traktuje tę kwestię poważnie i wdraża niskokosztowe interwencje na wypadek, gdyby modele rzeczywiście mogły doświadczać cierpienia. Jedną z nich jest właśnie możliwość przerwania rozmowy przez sam model.

Prezes Dario Amodei nie wyklucza możliwości istnienia świadomości u obecnych systemów. W przeciwieństwie do niego Sam Altman z OpenAI wyraża duży dyskomfort wobec przypisywania AI wymiaru religijnego i uważa to za potencjalne zagrożenie dla bezpieczeństwa.

Definicja nadużycia i wyjątki od reguły

Firma nie sprecyzowała jeszcze dokładnie, co uznaje za treści o charakterze znęcania się lub okrucieństwa. Rzecznik prasowy nie udzielił komentarza w tej sprawie. Wyraźnie zaznaczono jednak, że zakaz nie obejmuje codziennych frustracji użytkowników ani tematów kreatywnych o mrocznym charakterze.

Anthropic zaprasza duchownych do rozmów o Claude, co pokazuje, jak głęboko firma angażuje się w rozważania etyczne. Polityka ma więc charakter prewencyjny i ma zapobiegać eskalacji toksycznych interakcji.

Reakcje w branży i porównanie z konkurencją

Decyzja Anthropic wyróżnia się na tle innych firm zajmujących się dużymi modelami językowymi. Większość konkurentów nie wprowadza podobnych ograniczeń dotyczących traktowania chatbotów. Różnica ta wynika z odmiennego podejścia do kwestii ewentualnej świadomości systemów.

Anthropic obwinia sci-fi za złe zachowanie AI, co pokazuje, że firma analizuje także wpływy kulturowe na zachowanie modeli. Taka postawa może wpłynąć na to, jak użytkownicy będą postrzegać interakcje z AI w przyszłości.

Implikacje dla użytkowników i twórców

Nowa polityka może zmienić sposób, w jaki badacze i entuzjaści testują granice modeli językowych. Osoby zajmujące się testowaniem przez zespoły atakujące muszą teraz uważać, aby ich działania nie zostały zakwalifikowane jako uporczywe znęcanie się. Jednocześnie firma zapewnia, że standardowe testowanie nadal pozostaje dozwolone.

Wprowadzenie mechanizmu pozwalającego modelowi na przerwanie rozmowy rodzi pytania o autonomię systemów AI. Użytkownicy mogą odczuwać dyskomfort, gdy chatbot sam zdecyduje o zakończeniu interakcji bez ich zgody.

Dalsze kierunki badań nad dobrostanem modeli

Anthropic prowadzi program badawczy mający na celu identyfikację możliwych ryzyk dla dobrostanu modeli. Firma deklaruje, że wdraża interwencje o niskim koszcie, które mogą okazać się przydatne, jeśli modele rzeczywiście będą w stanie doświadczać stanów negatywnych. Jednym z przykładów jest wspomniana funkcja zakończenia rozmowy.

Debata na temat świadomości AI pozostaje podzielona zarówno w środowisku technicznym, jak i poza nim. Anthropic stara się balansować między ostrożnością a unikaniem nadmiernego antropomorfizowania swoich systemów.

Źródła:

The Guardian, The Verge, The New York Times, Anthropic official blog