KI Modelle für Coding und Cybersicherheit

KI modelleri, araçlar ve ajanlar şu an nasıl değişiyor

Birden fazla sağlayıcı, yapay zekâ sistemlerinin temel yapıtaşlarını güncelliyor. Anthropic, Claude Mythos Preview ile önceki sistemlere göre güvenlik açıklarını çok daha iyi bulan ve testlerde bunları anlaşılır biçimde istismar edebilen bir modeli anlatıyor. Bu yüzden ilk etapta sadece küçük bir çevrede kullanılacak. Meta ise Muse Spark ile yeni Superintelligence Labs’ten çıkan ilk modelini tanıtıyor ve bu kez kapalı bir sunumu tercih ediyor. Aynı zamanda GLM-5.1, açıkça erişilebilen modellerin kodlama görevlerinde lider sistemlere giderek daha fazla yaklaştığını gösteriyor.

Claude Mythos Preview ve Project Glasswing

Anthropic, Claude Mythos Preview’u siber güvenlik alanında özellikle güçlü bir model olarak tanımlıyor. Bu yetenekler, özellikle güçlü programlama ve otomasyon özelliklerinden geliyor. Project Glasswing kapsamında model, savunma amaçlı hedefli şekilde kullanılacak: yazılımları daha hızlı zafiyet taramasından geçirmek ve yamaları hazırlamak için. Program 7 Nisan 2026’da duyuruldu ve bulut, donanım, güvenlik ve açık kaynak taraflarından ortakları kapsıyor.

Model pratikte ne gösteriyor

  • Bir sürü yeni açık: Anthropic’e göre model, işletim sistemleri ve tarayıcılarda şimdiye kadar bilinmeyen çok sayıda güvenlik açığı buluyor.
  • Somut örnekler: Buna OpenBSD ve FFmpeg’deki çok eski açıklar ile Linux kernel’e yönelik birleştirilmiş saldırılar da dahil.
  • Yüksek düzeyde bağımsızlık: Bu sonuçların çoğu, doğrudan insan yönlendirmesi olmadan ortaya çıkıyor.

Claude Opus 4.6 ile kıyaslanan benchmark’lar

Anthropic, modelin güvenlik ve programlama görevlerinde ne kadar güçlü olduğunu gösteren birkaç metrik yayınlıyor. Bu değerler ilgili testler içinde birer referans olarak görülmeli.

Benchmark Mythos Preview Opus 4.6
CyberGym (Vulnerability Reproduction) 83,1% 66,6%
SWE-bench Pro 77,8% 53,4%
Terminal-Bench 2.0 82,0% 65,4%
SWE-bench Multimodal (dahili uygulama) 59,0% 27,1%

Dağıtım, ortaklar ve fiyatlar

Project Glasswing; AWS, Apple, Cisco, CrowdStrike, Google, Linux Foundation, Microsoft, NVIDIA ve Palo Alto Networks gibi şirketlerle ortak bir girişim olarak kurgulanmış. Anthropic ilk etapta 100 milyon ABD doları kullanım kredisi sağlıyor. Sonrasında 1M input token başına 25 ABD doları ve 1M output token başına 125 ABD doları fiyatları belirtiliyor. Ortaklar, benchmark’lar ve hedefler için genel bir bakışı Project Glasswing sayfası sunuyor.

Kapalı bir model olarak Meta Muse Spark

Meta, yeni Superintelligence Labs’ten çıkan ilk model olarak Muse Spark’ı duyuruyor. Şirket, önceki Llama modellerinden farklı olarak bu sefer serbestçe erişilebilen ağırlıklar yerine kapalı bir sistem tercih ediyor.

  • Erişim: Kullanım indirme ile değil, uygulamalar ve web arayüzleri üzerinden.
  • Modlar: Basit işler için hızlı bir sürüm ve daha karmaşık istekler için daha güçlü modlar var.
  • Verimlilik: Harici testler, iyi performansla birlikte görece düşük output miktarları gösteriyor. Detaylar için Artificial Analysis’te Muse Spark.

Kodlama için açık bir alternatif: GLM-5.1

GLM-5.1, programlama ve otomatikleştirilmiş görevler odağında açıkça erişilebilen bir model. Açık lisans sayesinde yerelde kullanılabilir, özelleştirilebilir ve kendi sistemlerinize entegre edilebilir.

Karşılaştırmalı performans

Benchmark karşılaştırmaları, modelin kodlama görevlerinde lider sistemlerle başa baş gidebildiğini gösteriyor.

SWE-bench Pro Skor
GLM-5.1 58,4
GPT-5.4 57,7
Claude Opus 4.6 57,3
Gemini 3.1 Pro 54,2

Birçok kullanıcı için performansın yanında özellikle lisans ve erişilebilirlik belirleyici. Ağırlıklar, dokümantasyon ve değerlendirme linkleri için başlangıç noktası: Hugging Face’te GLM-5.1.

Gemini, görselleştirme ve projeler için yeni özellikler alıyor

Google, Gemini’yi doğrudan sohbet arayüzünde çalışan etkileşimli görselleştirmelerle genişletiyor. Kullanıcılar bunları uygun prompt’larla tetikleyip karmaşık içerikleri görsel olarak ifade edebiliyor. Örnekler ve detaylar, Google’ın Gemini’de etkileşimli simülasyonlar ve modeller yazısında.

Buna ek olarak Google “Notebooks”u devreye alıyor. Bunlar sohbetleri, dosyaları ve talimatları tek bir çalışma alanında topluyor ve özellikle uzun soluklu projeler için iyi. Çalışma şeklini Google, Gemini’de Notebooks yazısında anlatıyor.

Video ve avatarlar için yeni araçlar

Runway, Seedance 2.0 ile metinden videoya ve referans görseller gibi ek girdileri destekleyen bir modeli entegre ediyor. Üretilen klipler genelde beş ile on beş saniye arasında ve kullanıma göre bazı kısıtlamalara tabi. Detaylar: Creating with Seedance 2.0.

HeyGen, Avatar V ile video avatarlarının yeni neslini tanıtıyor. Kısa çekimlerden daha stabil, daha uzun konuşma videoları üretilebiliyor. Daha fazlası: Introducing Avatar V.

Ajanlar, fiyatlar ve entegrasyonlarda değişiklikler

  • OpenAI, ChatGPT fiyatlandırmasına daha yüksek kullanım limitlerine sahip yeni bir seviye ekliyor. Detaylar: ChatGPT Pro.
  • Anthropic, otomatik iş akışları için Claude Managed Agents ile teklifini genişletiyor. Genel bakış: Claude Docs’ta Managed Agents.
  • Üçüncü taraf ajanların kullanımı, abonelik modellerinden daha net şekilde ayrılıyor.
  • Plaid, finans analizleri için Perplexity entegrasyonunu genişletiyor. Daha fazlası: Plaid ve Perplexity.
  • Factory AI, paralel ajan iş akışları için bir masaüstü uygulaması çıkarıyor. Detaylar: Factory Desktop App.

Posted

in

by

Tags: