Kilku dostawców rozwija kluczowe elementy swoich systemów KI. Anthropic opisuje Claude Mythos Preview jako model, który wyraźnie lepiej niż dotychczasowe systemy znajduje luki bezpieczeństwa i w testach potrafi je w zrozumiały sposób wykorzystać. Dlatego na początku ma być używany tylko w wąskim gronie. Meta pokazuje Muse Spark jako swój pierwszy model z nowych Superintelligence Labs i stawia przy tym na zamkniętą dystrybucję. Jednocześnie GLM-5.1 udowadnia, że otwarcie dostępne modele w zadaniach programistycznych coraz bardziej zbliżają się do czołowych systemów.
Claude Mythos Preview i Project Glasswing
Anthropic opisuje Claude Mythos Preview jako wyjątkowo mocny model w obszarze cyberbezpieczeństwa. Te możliwości wynikają przede wszystkim z silnych funkcji programowania i automatyzacji. W ramach Project Glasswing model ma być celowo używany defensywnie, żeby szybciej sprawdzać oprogramowanie pod kątem podatności i przygotowywać poprawki. Program zaprezentowano 7 kwietnia 2026 r. i obejmuje partnerów z obszarów chmury, sprzętu, security i open source.
Co model pokazuje w praktyce
- Wiele nowych podatności: Według Anthropica model znajduje liczne wcześniej nieznane luki bezpieczeństwa w systemach operacyjnych i przeglądarkach.
- Konkretne przykłady: To m.in. bardzo stare podatności w OpenBSD i FFmpeg oraz łączone ataki na jądro Linuksa.
- Duża samodzielność: Wiele z tych wyników powstaje bez bezpośredniego sterowania przez człowieka.
Benchmarki w porównaniu z Claude Opus 4.6
Anthropic publikuje kilka wskaźników, które pokazują, jak mocny jest model w zadaniach z bezpieczeństwa i programowania. Wartości służą jako orientacja w ramach danych testów.
| Benchmark | Mythos Preview | Opus 4.6 |
|---|---|---|
| CyberGym (Vulnerability Reproduction) | 83,1% | 66,6% |
| SWE-bench Pro | 77,8% | 53,4% |
| Terminal-Bench 2.0 | 82,0% | 65,4% |
| SWE-bench Multimodal (wewnętrzna implementacja) | 59,0% | 27,1% |
Dystrybucja, partnerzy i ceny
Project Glasswing jest zaprojektowany jako wspólna inicjatywa z firmami takimi jak AWS, Apple, Cisco, CrowdStrike, Google, Linux Foundation, Microsoft, NVIDIA i Palo Alto Networks. Anthropic na start udostępnia 100 mln dolarów kredytów na użycie. Później podawane są ceny 25 USD za 1M tokenów wejściowych i 125 USD za 1M tokenów wyjściowych. Przegląd partnerów, benchmarków i celów znajdziesz na Project Glasswing.
Meta Muse Spark jako model zamknięty
Meta pokazuje Muse Spark jako swój pierwszy model z nowych Superintelligence Labs. W przeciwieństwie do wcześniejszych modeli Llama firma tym razem stawia na system zamknięty zamiast na swobodnie dostępne wagi.
- Dostęp: Użycie odbywa się przez aplikacje i interfejsy webowe, a nie przez pobieranie.
- Tryby: Jest szybka wersja do prostych zadań oraz mocniejsze tryby do złożonych zapytań.
- Efektywność: Zewnętrzne testy pokazują relatywnie niską ilość outputu przy dobrej wydajności. Szczegóły są w Muse Spark na Artificial Analysis.
GLM-5.1 jako otwarta alternatywa do kodowania
GLM-5.1 to otwarcie dostępny model skoncentrowany na programowaniu i zadaniach automatyzacji. Dzięki otwartej licencji można go uruchamiać lokalnie, dostosowywać i integrować z własnymi systemami.
Wydajność w porównaniu
Porównania benchmarków pokazują, że model w zadaniach programistycznych potrafi dotrzymać kroku wiodącym systemom.
| SWE-bench Pro | Wynik |
|---|---|
| GLM-5.1 | 58,4 |
| GPT-5.4 | 57,7 |
| Claude Opus 4.6 | 57,3 |
| Gemini 3.1 Pro | 54,2 |
Dla wielu użytkowników obok wydajności kluczowe są przede wszystkim licencja i dostępność. Punkt startowy do wag, dokumentacji i linków do ewaluacji to GLM-5.1 na Hugging Face.
Gemini dostaje nowe funkcje do wizualizacji i projektów
Google rozbudowuje Gemini o interaktywne wizualizacje, które działają bezpośrednio w interfejsie czatu. Użytkownicy mogą je uruchamiać odpowiednimi promptami i w ten sposób wizualnie przedstawiać złożone treści. Przykłady i szczegóły Google pokazuje we wpisie o interaktywnych symulacjach i modelach w Gemini.
Dodatkowo Google wprowadza „Notebooks”. Zbierają one czaty, pliki i instrukcje w jednej przestrzeni roboczej i szczególnie dobrze nadają się do dłuższych projektów. Jak to działa, Google opisuje we wpisie o Notebooks w Gemini.
Nowe narzędzia do wideo i awatarów
Runway integruje Seedance 2.0, czyli model do text-to-video oraz innych wejść, takich jak obrazy referencyjne. Wygenerowane klipy mają zwykle od pięciu do piętnastu sekund i w zależności od sposobu użycia podlegają pewnym ograniczeniom. Szczegóły znajdziesz w Creating with Seedance 2.0.
HeyGen prezentuje Avatar V jako nową generację wideo-awatarów. Z krótkich nagrań można tworzyć stabilne, dłuższe wideo z mową. Więcej we wpisie Introducing Avatar V.
Zmiany w agentach, cenach i integracjach
- OpenAI uzupełnia strukturę cenową ChatGPT o nowy poziom z wyższymi limitami użycia. Szczegóły: ChatGPT Pro.
- Anthropic rozszerza ofertę o Claude Managed Agents do zautomatyzowanych procesów. Przegląd: Managed Agents w dokumentacji Claude.
- Korzystanie z agentów firm trzecich jest mocniej oddzielane od modeli subskrypcyjnych.
- Plaid rozbudowuje integrację z Perplexity do analiz finansowych. Więcej w wpisie na blogu Plaid i Perplexity.
- Factory AI wypuszcza aplikację desktopową do równoległych workflowów agentowych. Szczegóły: Factory Desktop App.

