3min Security

Cisco Provenance Explorer: een keurmerk voor LLM’s

Cisco Provenance Explorer: een keurmerk voor LLM’s

Cisco introduceert de AI Supply Chain Provenance Explorer. Het is een openbare tool om open-weight AI-modellen te beoordelen voordat organisaties ze inzetten. De dienst kijkt naar de herkomst, licenties, securitybevindingen en context van de leverancier voor de beoordeling. Inmiddels staat de teller voor gecatalogiseerde LLM’s al op bijna 900.

Een open-weight AI-model is minder transparent dan het lijkt bij het downloaden ervan, zo stelt Cisco. Een repository vermeldt doorgaans de naam, de aanbieder en de licentie, maar niet waar een model vandaan komt, hoe het is aangepast of welke securitygevaren eraan kleven. Provenance Explorer haalt die blinde vlek weg.

De tool brengt per model verschillende categorieën informatie samen. Denk aan modeldetails zoals het aantal parameters en voor training gebruikte tokens, informatie over de provider inclusief hoofdvestiging, en licentievoorwaarden met eventuele beperkingen voor gebruik. Ook security-assessments zijn van belang. De LLM’s worden daarom gescand met ClamAV op kwetsbaarheden.

Herkomst niet op naam alleen

We spreken hier van open-weight modellen ook al kiest Cisco voor de naamgeving van open-source. Dit omdat LLM’s vrijwel nooit een transparante dataset voor training hebben. Hierdoor is het niet mogelijk om een nieuwe training-run te doen; enkel aanpassingen zijn mogelijk.

LLM’s worden dan ook gefinetuned, gedistilleerd, samengevoegd en opnieuw uitgebracht, vaak meerdere keren. Onderweg raakt context verloren. Cisco baseert de relaties tussen modellen daarom niet op de zelf gerapporteerde afkomst, maar op similarity scores vanuit de Model Provenance Kit en het Project VAIL.

Die Model Provenance Kit bracht Cisco eerder dit jaar uit. De opensource-toolkit analyseert metadata rondom de architectuur, tokenizer en gewichten om te bepalen of modellen een gemeenschappelijke oorsprong delen. Op een benchmark van 111 modelparen haalde de kit een precisie van 98,1 procent bij een drempelwaarde van 0,70.

Dat heeft verschillende redenen. Allereerst hebben verschillende AI-spelers verschillende tokenizers, ofwel systemen die taal, beelden en andere informatie als trainingsdata omzetten naar losse stukjes die hergebruikt kunnen worden voor gegenereerde teksten.

Begrijp je “model estate”

Het wordt voor veel organisaties tijd om hun “model estate”, om maar een term te introduceren, scherp te hebben. Op de Hugging Face Hub staan inmiddels ruim 2 miljoen modellen, wat het aanvalsoppervlak van AI-systemem gigantisch maakt. “Model poisoning” is een reëel risico en lastig te detecteren.

Cisco timmert al langer aan de weg rond veilige AI. Vorig jaar bracht het Foundation AI met een opensource security-model, en recent de Antares-modellen die kwetsbaarheden in code opsporen. Ook AI Defense, dat individuele LLM’s onder de loep nam, past in deze lijn.

De informatie in de Explorer wordt volgens Cisco regelmatig bijgewerkt en geverifieerd door het AI Threat & Security Research-team, samen met Project VAIL. De tool is vanaf nu publiek beschikbaar.