KI Modelle für Coding und Cybersicherheit

Jak właśnie zmieniają się modele KI, narzędzia i agenci

Kilku dostawców rozwija kluczowe elementy swoich systemów KI. Anthropic opisuje Claude Mythos Preview jako model, który wyraźnie lepiej niż dotychczasowe systemy znajduje luki bezpieczeństwa i w testach potrafi je w zrozumiały sposób wykorzystać. Dlatego na początku ma być używany tylko w wąskim gronie. Meta pokazuje Muse Spark jako swój pierwszy model z nowych Superintelligence Labs i stawia przy tym na zamkniętą dystrybucję. Jednocześnie GLM-5.1 udowadnia, że otwarcie dostępne modele w zadaniach programistycznych coraz bardziej zbliżają się do czołowych systemów.

Claude Mythos Preview i Project Glasswing

Anthropic opisuje Claude Mythos Preview jako wyjątkowo mocny model w obszarze cyberbezpieczeństwa. Te możliwości wynikają przede wszystkim z silnych funkcji programowania i automatyzacji. W ramach Project Glasswing model ma być celowo używany defensywnie, żeby szybciej sprawdzać oprogramowanie pod kątem podatności i przygotowywać poprawki. Program zaprezentowano 7 kwietnia 2026 r. i obejmuje partnerów z obszarów chmury, sprzętu, security i open source.

Co model pokazuje w praktyce

  • Wiele nowych podatności: Według Anthropica model znajduje liczne wcześniej nieznane luki bezpieczeństwa w systemach operacyjnych i przeglądarkach.
  • Konkretne przykłady: To m.in. bardzo stare podatności w OpenBSD i FFmpeg oraz łączone ataki na jądro Linuksa.
  • Duża samodzielność: Wiele z tych wyników powstaje bez bezpośredniego sterowania przez człowieka.

Benchmarki w porównaniu z Claude Opus 4.6

Anthropic publikuje kilka wskaźników, które pokazują, jak mocny jest model w zadaniach z bezpieczeństwa i programowania. Wartości służą jako orientacja w ramach danych testów.

Benchmark Mythos Preview Opus 4.6
CyberGym (Vulnerability Reproduction) 83,1% 66,6%
SWE-bench Pro 77,8% 53,4%
Terminal-Bench 2.0 82,0% 65,4%
SWE-bench Multimodal (wewnętrzna implementacja) 59,0% 27,1%

Dystrybucja, partnerzy i ceny

Project Glasswing jest zaprojektowany jako wspólna inicjatywa z firmami takimi jak AWS, Apple, Cisco, CrowdStrike, Google, Linux Foundation, Microsoft, NVIDIA i Palo Alto Networks. Anthropic na start udostępnia 100 mln dolarów kredytów na użycie. Później podawane są ceny 25 USD za 1M tokenów wejściowych i 125 USD za 1M tokenów wyjściowych. Przegląd partnerów, benchmarków i celów znajdziesz na Project Glasswing.

Meta Muse Spark jako model zamknięty

Meta pokazuje Muse Spark jako swój pierwszy model z nowych Superintelligence Labs. W przeciwieństwie do wcześniejszych modeli Llama firma tym razem stawia na system zamknięty zamiast na swobodnie dostępne wagi.

  • Dostęp: Użycie odbywa się przez aplikacje i interfejsy webowe, a nie przez pobieranie.
  • Tryby: Jest szybka wersja do prostych zadań oraz mocniejsze tryby do złożonych zapytań.
  • Efektywność: Zewnętrzne testy pokazują relatywnie niską ilość outputu przy dobrej wydajności. Szczegóły są w Muse Spark na Artificial Analysis.

GLM-5.1 jako otwarta alternatywa do kodowania

GLM-5.1 to otwarcie dostępny model skoncentrowany na programowaniu i zadaniach automatyzacji. Dzięki otwartej licencji można go uruchamiać lokalnie, dostosowywać i integrować z własnymi systemami.

Wydajność w porównaniu

Porównania benchmarków pokazują, że model w zadaniach programistycznych potrafi dotrzymać kroku wiodącym systemom.

SWE-bench Pro Wynik
GLM-5.1 58,4
GPT-5.4 57,7
Claude Opus 4.6 57,3
Gemini 3.1 Pro 54,2

Dla wielu użytkowników obok wydajności kluczowe są przede wszystkim licencja i dostępność. Punkt startowy do wag, dokumentacji i linków do ewaluacji to GLM-5.1 na Hugging Face.

Gemini dostaje nowe funkcje do wizualizacji i projektów

Google rozbudowuje Gemini o interaktywne wizualizacje, które działają bezpośrednio w interfejsie czatu. Użytkownicy mogą je uruchamiać odpowiednimi promptami i w ten sposób wizualnie przedstawiać złożone treści. Przykłady i szczegóły Google pokazuje we wpisie o interaktywnych symulacjach i modelach w Gemini.

Dodatkowo Google wprowadza „Notebooks”. Zbierają one czaty, pliki i instrukcje w jednej przestrzeni roboczej i szczególnie dobrze nadają się do dłuższych projektów. Jak to działa, Google opisuje we wpisie o Notebooks w Gemini.

Nowe narzędzia do wideo i awatarów

Runway integruje Seedance 2.0, czyli model do text-to-video oraz innych wejść, takich jak obrazy referencyjne. Wygenerowane klipy mają zwykle od pięciu do piętnastu sekund i w zależności od sposobu użycia podlegają pewnym ograniczeniom. Szczegóły znajdziesz w Creating with Seedance 2.0.

HeyGen prezentuje Avatar V jako nową generację wideo-awatarów. Z krótkich nagrań można tworzyć stabilne, dłuższe wideo z mową. Więcej we wpisie Introducing Avatar V.

Zmiany w agentach, cenach i integracjach

  • OpenAI uzupełnia strukturę cenową ChatGPT o nowy poziom z wyższymi limitami użycia. Szczegóły: ChatGPT Pro.
  • Anthropic rozszerza ofertę o Claude Managed Agents do zautomatyzowanych procesów. Przegląd: Managed Agents w dokumentacji Claude.
  • Korzystanie z agentów firm trzecich jest mocniej oddzielane od modeli subskrypcyjnych.
  • Plaid rozbudowuje integrację z Perplexity do analiz finansowych. Więcej w wpisie na blogu Plaid i Perplexity.
  • Factory AI wypuszcza aplikację desktopową do równoległych workflowów agentowych. Szczegóły: Factory Desktop App.

Posted

in

by

Tags: