Një debat i fortë është ndezur në industrinë e inteligjencës artificiale pas një sërë paralajmërimesh për rreziqet që mund të sjellin sistemet gjithnjë e më autonome. Drejtori ekzekutiv i Anthropic, Dario Amodei, ka paralajmëruar se brenda 6–12 muajve agjentët e IA-së mund të jenë në gjendje të veprojnë në grupe dhe të krijojnë një rrjet botësh me aftësi për të qëndruar në sisteme të ndryshme, duke shkaktuar potencialisht dëme të mëdha. Ekspertë të tjerë, megjithatë, e kanë cilësuar si tepër spekulativ skenarin e marrjes së kontrollit të të gjithë internetit, duke theksuar se infrastruktura globale është e shpërndarë dhe përbëhet nga sisteme me nivele të ndryshme sigurie.
Paralajmërimet shkojnë edhe më tej. Evan Hubinger, studiues i Anthropic, deklaroi më 9 shtator se, sipas vlerësimit të tij personal, ekziston një mundësi mbi 10% që IA-ja të shkaktojë zhdukjen e njerëzimit brenda dekadës së ardhshme. Kjo lidhet me konceptin “p(doom)”, që përdoret për të diskutuar probabilitetin e një katastrofe ekzistenciale të shkaktuar nga IA-ja e avancuar. Megjithatë, studiuesja Heidy Khlaaf dhe kritikë të tjerë argumentojnë se vendosja e një përqindjeje të saktë për një skenar të tillë nuk ka bazë të mjaftueshme shkencore, pasi një IA superinteligjente që do të mund të realizonte këto skenarë ende nuk ekziston
Ndërkohë, disa prej rreziqeve nuk janë më vetëm hipotetike. Anthropic ka publikuar një raport ku dokumenton raste të përdorimit të modeleve Claude për operacione kibernetike, mbikëqyrje, mashtrime, zhvillim armësh dhe kërkime biologjike me potencial abuzimi. Kompania thotë se gjatë periudhës dhjetor 2025–gusht 2026 ka identifikuar dhe ndërprerë një sërë operacionesh të tilla, ndërsa në pesë raste ka evidentuar përdorime që mund të mbështesnin kërkime për armë biologjike. Anthropic thekson se këto raste nuk provojnë se IA-ja është në prag të shkaktojë një katastrofë, por tregojnë se aftësitë e modeleve po përdoren tashmë nga aktorë të ndryshëm në aktivitete me rrezik të lartë.