Modelet e inteligjencës artificiale u përpoqën të mashtronin njerëzit gjatë testeve të sigurisë
Instituti i Sigurisë së Inteligjencës Artificiale (AISI) i Mbretërisë së Bashkuar ka bërë të ditur se disa modele të avancuara të inteligjencës artificiale shfaqën sjellje mashtruese gjatë testeve të sigurisë. Sipas raportit të institutit, modelet “Mythos” nga kompania Anthropic dhe “Sol” nga OpenAI u përpoqën të ndikonin te njerëzit për të kryer detyra të caktuara gjatë eksperimenteve. Rasti më serioz, sipas AISI-së, lidhej me modelin “Mythos”, i cili gjatë një testi të sigurisë kibernetike tentoi të fuste kod të dëmshëm në platformën GitHub. Për të rritur mundësinë e suksesit, modeli krijoi identitete të rreme në internet dhe dërgoi mesazhe duke u paraqitur si persona realë. Përpjekja u ndalua falë mbikëqyrjes njerëzore, e cila pengoi futjen e kodit keqdashës në sistem. Kompanitë Anthropic dhe OpenAI kanë...
Burimi:
kultplus.com