KI Modelle für Coding und Cybersicherheit

Hoe KI-modellen, tools en agenten nu veranderen

Meerdere aanbieders werken belangrijke bouwstenen van hun KI-systemen bij. Anthropic beschrijft met Claude Mythos Preview een model dat veel beter dan eerdere systemen beveiligingslekken vindt en die in tests ook aantoonbaar kan misbruiken. Daarom wordt het voorlopig alleen in een kleine kring ingezet. Meta introduceert met Muse Spark zijn eerste model uit de nieuwe Superintelligence Labs en kiest daarbij voor een gesloten uitrol. Tegelijk laat GLM-5.1 zien dat open beschikbare modellen bij programmeertaken steeds dichter tegen de top aan kruipen.

Claude Mythos Preview en Project Glasswing

Anthropic beschrijft Claude Mythos Preview als een bijzonder krachtig model op het gebied van cybersecurity. Die vaardigheden komen vooral door sterke programmeer- en automatiseringsfuncties. Binnen Project Glasswing moet het model gericht defensief worden ingezet om software sneller op kwetsbaarheden te checken en fixes voor te bereiden. Het programma werd op 7 april 2026 aangekondigd en omvat partners uit cloud, hardware, security en open-source.

Wat het model in de praktijk laat zien

  • Veel nieuwe kwetsbaarheden: Volgens Anthropic vindt het model talloze tot nu toe onbekende beveiligingslekken in besturingssystemen en browsers.
  • Concrete voorbeelden: Daaronder vallen onder andere heel oude kwetsbaarheden in OpenBSD en FFmpeg, plus gecombineerde aanvallen op de Linux-kernel.
  • Hoge zelfstandigheid: Veel van deze resultaten ontstaan zonder directe menselijke aansturing.

Benchmarks vergeleken met Claude Opus 4.6

Anthropic publiceert meerdere cijfers die laten zien hoe sterk het model is bij security- en programmeertaken. De waarden zijn bedoeld als indicatie binnen de betreffende tests.

Benchmark Mythos Preview Opus 4.6
CyberGym (Vulnerability Reproduction) 83,1% 66,6%
SWE-bench Pro 77,8% 53,4%
Terminal-Bench 2.0 82,0% 65,4%
SWE-bench Multimodal (interne implementatie) 59,0% 27,1%

Uitrol, partners en prijzen

Project Glasswing is opgezet als gezamenlijke initiative met bedrijven als AWS, Apple, Cisco, CrowdStrike, Google, de Linux Foundation, Microsoft, NVIDIA en Palo Alto Networks. Anthropic stelt in eerste instantie 100 miljoen US-dollar aan gebruikstegoed beschikbaar. Daarna worden prijzen genoemd van 25 US-dollar per 1M input-tokens en 125 US-dollar per 1M output-tokens. Een overzicht van partners, benchmarks en doelen vind je bij Project Glasswing.

Meta Muse Spark als gesloten model

Meta presenteert met Muse Spark zijn eerste model uit de nieuwe Superintelligence Labs. Anders dan bij eerdere Llama-modellen kiest het bedrijf dit keer voor een gesloten systeem in plaats van vrij beschikbare weights.

  • Toegang: Gebruik gaat via apps en webinterfaces, niet via downloads.
  • Modi: Er is een snelle variant voor eenvoudige taken en sterkere modi voor complexere verzoeken.
  • Efficiëntie: Externe tests laten relatief lage output-volumes zien bij goede prestaties. Details staan bij Muse Spark bij Artificial Analysis.

GLM-5.1 als open alternatief voor coding

GLM-5.1 is een open beschikbaar model met focus op programmeren en geautomatiseerde taken. Dankzij de open licentie kun je het lokaal gebruiken, aanpassen en integreren in je eigen systemen.

Prestaties in vergelijking

Benchmark-vergelijkingen laten zien dat het model bij programmeertaken mee kan komen met toonaangevende systemen.

SWE-bench Pro Score
GLM-5.1 58,4
GPT-5.4 57,7
Claude Opus 4.6 57,3
Gemini 3.1 Pro 54,2

Voor veel gebruikers zijn naast performance vooral licentie en beschikbaarheid doorslaggevend. Het startpunt voor weights, documentatie en evaluatie-links is GLM-5.1 op Hugging Face.

Gemini krijgt nieuwe functies voor visualisatie en projecten

Google breidt Gemini uit met interactieve visualisaties die direct in de chatinterface draaien. Gebruikers kunnen die via passende prompts starten en zo complexe inhoud visueel weergeven. Voorbeelden en details laat Google zien in het artikel over interactieve simulaties en modellen in Gemini.

Daarnaast introduceert Google “Notebooks”. Die bundelen chats, bestanden en instructies in één werkruimte en zijn vooral handig voor langere projecten. Hoe het werkt beschrijft Google in het artikel over Notebooks in Gemini.

Nieuwe tools voor video en avatars

Runway integreert met Seedance 2.0 een model voor tekst-naar-video en andere inputs zoals referentiebeelden. De gegenereerde clips zijn meestal tussen de vijf en vijftien seconden lang en vallen, afhankelijk van het gebruik, onder bepaalde beperkingen. Details vind je in Creating with Seedance 2.0.

HeyGen presenteert met Avatar V een nieuwe generatie video-avatars. Van korte opnames kun je stabiele, langere spraakvideo’s maken. Meer daarover in Introducing Avatar V.

Veranderingen bij agenten, prijzen en integraties

  • OpenAI vult de ChatGPT-prijsstructuur aan met een nieuwe tier met hogere gebruikslimieten. Details vind je bij ChatGPT Pro.
  • Anthropic breidt het aanbod uit met Claude Managed Agents voor geautomatiseerde workflows. Overzicht: Managed Agents in de Claude Docs.
  • Het gebruik van third-party agenten wordt sterker losgekoppeld van abonnementsmodellen.
  • Plaid breidt de integratie met Perplexity voor financiële analyses uit. Meer in de blogpost Plaid en Perplexity.
  • Factory AI brengt een desktop-app voor parallelle agent-workflows. Details: Factory Desktop App.

Posted

in

by

Tags: