Skip to content
All research
About 10 min readMarkdown ↗

Claude Sonnet 5, agent calistirma maliyetini dusurme ve Opus seviyesine yaklasma iddiasiyla cikti; AWS Bedrock duyurusu enterprise…

Published by Mahsum Aktaş · Automated daily AI industry scan

Compiled automatically by an AI agent. Check the linked sources for context and verification.

This report is only available in Turkish.
In this report

At a glance

Otomatik derleme | v3 pipeline | 8.371 ham kaynak | 2.758 benzersiz item | 106 benzersiz kaynak | 5/5 kaynak ailesi kapsandi

Günün özeti

Bugunun ekseni uc hatta toplandi: daha ucuz/agent odakli model katmani, bilim ve enterprise icin paketlenmis AI is akislari, agent guvenligi. Anthropic Claude Sonnet 5'i daha ucuz agent calistirma iddiasiyla cikardi ve AWS Bedrock tarafinda da duyurdu; ayni gun Claude Science, bilim insanlarina tek workbench sunan ayri bir urun olarak one cikti. Kaynak: techcrunch.com ve aws.amazon.com ve anthropic.com

Ikinci ana hat, AI altyapisinin model duyurusundan "saha ekibi + chip + maliyet" modeline kaymasi: Amazon 1 milyar dolarlik forward-deployed engineering organizasyonu kurarken, Etched $5B degerleme ve $1B satis kontrati sinyaliyle inference donaniminda Nvidia disi ciddi bir cephe acti. Kaynak: techcrunch.com ve techcrunch.com

Ucuncu hat guvenlik: Microsoft poisoned MCP tool descriptions riskini, HN ise Claude Code request steganography tartismasini one cikardi; agent ekosistemi artik sadece capability degil, tool metadata, iz surme, policy ve bellek sızıntısı problemi. Kaynak: news.google.com ve thereallo.dev

Top 7

  1. Claude Sonnet 5, agent calistirma maliyetini dusurme ve Opus seviyesine yaklasma iddiasiyla cikti; AWS Bedrock duyurusu enterprise dagitimini de ayni anda guclendirdi. Kaynak: techcrunch.com ve aws.amazon.com
  2. Claude Science, bilimsel arastirma icin hazir skill setleri, computational workflow ve verification agent yaklasimi ile "model" degil "research operating system" iddiasi tasiyor. Kaynak: anthropic.com ve techcrunch.com
  3. OpenAI GeneBench-Pro, genomik ve biyoloji icin gercek dunya datasetleriyle bilimsel model performansini olcmeye odaklaniyor. Kaynak: openai.com
  4. Etched, inference chip pazarinda $5B degerleme ve $1B kontratla cikti; custom silicon savasi sadece Nvidia/Google/AMD degil, vertical startup katmanina indi. Kaynak: techcrunch.com
  5. Amazon, $1B FDE organizasyonu ile musteri icine gomulen AI deployment modelini OpenAI/Anthropic cizgisine tasiyor. Kaynak: techcrunch.com
  6. Microsoft'un poisoned MCP tool description uyarisı, agent tool metadata'sinin yeni prompt injection yuzeyi oldugunu netlestirdi. Kaynak: news.google.com
  7. Agent memory, policy verifier ve context management paper yığını ayni sinyali verdi: long-horizon agent icin memory sadece recall degil, leak, confound ve policy compliance meselesi. Kaynak: arxiv.org ve arxiv.org ve arxiv.org

Trend Analizi

  • Spike: Sonnet, RAG, Perplexity ve Stability AI trend penceresinde sicrama verdi; bugunku Sonnet 5 ve Claude Science haberleri "Anthropic rising" sinyalini besledi. Kaynak: anthropic.com ve anthropic.com
  • Yukselis: AI Agents 973 toplam iz, Anthropic 521, Amazon 52; bu, model release haberinden ziyade deployment, FDE ve agent ops katmaninin buyudugunu gosteriyor. Kaynak: techcrunch.com
  • RAG 148 toplam ile halen sicak; bugunku arastirma tarafinda AB-RAG, PIXELRAG, Regime-Aware Peer Specialization ve Efficient RAG papers kaynak kalitesinin "retrieval budget" ve "context type" eksenine kaydigini gosteriyor. Kaynak: arxiv.org ve arxiv.org ve arxiv.org

Modeller

  • AI startup'larinda "model + servis + saha ekibi" kombinasyonu hizlaniyor: Amazon FDE organizasyonu, OpenAI ve Anthropic'in enterprise deployment yaklasimini AWS icine kopyaliyor. Kaynak: cnbc.com
  • Etched vakasi, inference donaniminda "genel GPU" yerine model odakli accelerator stratejisinin ticari alici buldugunu gosteriyor. Kaynak: techcrunch.com
  • 8090 Labs'in $135M yatirimi, AI software development pazarinda coding-agent tooling'in hala sermaye cekebildigini gosteriyor. Kaynak: webrazzi.com

Araştırmalar

  • Claude Sonnet 5, Sonnet 4.6'ya gore coding/reasoning iyilestirmesi ve agent maliyeti mesajiyla geldi; Simon Willison tokenizer maliyet notunda Ingilizce token maliyetinin ~1.4x etkilenebilecegini isaret etti. Kaynak: anthropic.com ve simonwillison.net
  • Nemotron-Labs-Diffusion-Image, masked discrete diffusion ile high-resolution text-to-image synthesis tarafinda yeni bir NVIDIA arastirma hattı sundu. Kaynak: arxiv.org
  • Meituan LongCat-2.0, 1.6T toplam / ~48B active MoE anlatısıyla Cin chip ekosisteminin Nvidia bagimsiz model egitimi iddiasini guclendiriyor. Kaynak: the-decoder.com

Araçlar ve kütüphaneler

  • Simon Willison shot-scraper video ile coding agent'larin YAML storyboard'dan video demo kaydedebilmesini saglayan pratik bir automation araci duyurdu. Kaynak: simonwillison.net
  • Cursor, coding agent'larini iOS uzerinden baslatma/izleme/review etme akisini mobil beta ile genisletti. Kaynak: webrazzi.com
  • Apify'nin AI agent tool sayisini 10x artirdigi haber akisi, browser/data extraction araclarinin agent runtime icin standart parca olmaya basladigini gosteriyor. Kaynak: news.google.com

Açık kaynak

  • GeneBench-Pro, biology/genomics benchmark tarafinda "complex real-world datasets" vurgusu ile bilimsel AI degerlendirmesini tekil quiz benchmark'larindan uzaklastiriyor. Kaynak: openai.com
  • SEVA, fact attribution verifier'larinin self-evolving process reward ile iyilestirilmesini oneriyor; hallucination savunmasinda "son katman verifier" daha aktif hale geliyor. Kaynak: arxiv.org
  • Complexity Ceiling Benchmark, sequential reasoning derinligi arttikca model performansinin nasil kirildigini kontrollu sekilde olcmeye calisiyor. Kaynak: arxiv.org

Sektör ve şirketler

  • Anthropic, Claude Science ile biopharma ve bilimsel arastirma pazarina dogrudan urunlestirilmis workflow satma yoluna girdi. Kaynak: techcrunch.com
  • Base44'un kendi modelini roll out etmeye baslamasi, vibe-coding platformlarinin sadece wrapper kalmamak icin model defensibility aradigini gosteriyor. Kaynak: techcrunch.com
  • Globant-Anthropic "Claude-powered AI Pods" isbirligi, system integrator'larin model laboratuvarlariyla daha paketli teslimat modeli kurdugunu gosteriyor. Kaynak: news.google.com

AI ajanları

  • Agent-as-a-Router, coding task'leri icin hangi modelin secilecegini agentic routing problemi olarak ele aliyor; bu, multi-provider maliyet/kalite orkestrasyonu icin dogrudan uygulanabilir. Kaynak: arxiv.org
  • LLM Agents Are Latent Context Managers, uzun ufuklu tool agent'larda context'in kendisinin yonetilmesi gereken bir runtime kaynagi oldugunu vurguluyor. Kaynak: arxiv.org
  • Scaling the Horizon, Not the Parameters, 35B agent'in horizon scaling ile daha buyuk model performansina yaklasabilecegini iddia ediyor; parametre yerine planlama ufku optimizasyonu one cikiyor. Kaynak: arxiv.org

Çok modlu AI

  • Core dump epidemiology yazisi, OpenAI'in buyuk olcekli core dump analiziyle hem hardware fault hem 18 yillik software bug buldugunu anlatiyor; AI altyapisi artik klasik reliability engineering'e daha fazla bagimli. Kaynak: openai.com
  • Speculative Pre-Positioning, stateful session'larda bir sonraki karar noktasina off-critical-path decode yaparak vLLM/SGLang/TensorRT-LLM benzeri server'larda bos GPU zamanini azaltmayi hedefliyor. Kaynak: arxiv.org
  • One-Step Gradient Delay, asenkron pipeline parallel LLM pretraining'de GPU bubble kaybini azaltmak icin gecikmenin teorik bariyer olmadigini savunuyor. Kaynak: arxiv.org

Robotik

  • Microsoft'un MCP tool description poisoning uyarisı, agent'larin sadece user prompt'tan degil, tool metadata'sindan da etkilenebildigini gosteriyor. Kaynak: news.google.com
  • 282 iOS AI app'inin API key/proxy access leak ettigi calisma, consumer AI app tedarik zincirinde client-side secret hijyeninin hala zayif oldugunu gosteriyor. Kaynak: news.google.com
  • Claude Code request steganography tartismasi, agent request'lerinin izlenebilirlik/filigran/telemetry katmaninda opak riskler tasiyabilecegini gundeme tasidi. Kaynak: thereallo.dev

Cihaz üzerinde AI

  • HN'de Claude Sonnet 5, 681 puan ve 358 yorumla gunun ana teknik tartismasi oldu; benchmark kadar fiyat/tokenizer davranisi da konusuldu. Kaynak: anthropic.com
  • HN'de Claude Science, bilimsel workflow urunlesmesi uzerinden "AI workbench mi, model mi" tartismasini tetikledi. Kaynak: claude.com
  • Reddit LocalLLaMA'da LongCat-2.0 ve DeepSeek V4 Flash GGUF basliklari local/open-weight inference tarafindaki ilgiyi canli tuttu. Kaynak: reddit.com ve reddit.com

Güvenlik

  • Langflow RCE'nin Monero miner deployment icin kullanildigi haber akisi, AI app endpoint'lerinin klasik internet-exposed app risklerinden muaf olmadigini tekrar gosterdi. Kaynak: news.google.com
  • An Empirical Evaluation of Prompt Injection Vulnerabilities in LLMs, multilingual ve obfuscated attack senaryolarinda prompt injection riskini sistematik test ediyor. Kaynak: arxiv.org
  • SrDetection, Code LLM benchmark'larinda data leakage tespitini self-referential framework ile ele aliyor; coding benchmark skorlarina guven problemi buyuyor. Kaynak: arxiv.org

Düzenlemeler

  • 35 news publisher'in OpenAI'a scraping iddiasiyla dava actigi haber, telif/regulasyon ekseninde veri kaynagi tartismasinin surdugunu gosteriyor. Kaynak: news.google.com
  • CIA'nin AI cagina gore tech/acquisition ofislerini yeniden yapilandirdigi haber, kamu tedarik ve istihbarat operasyonlarinda AI'nin organizasyonel degisim tetikledigini gosteriyor. Kaynak: news.google.com
  • Modernizing Global Vulnerability Standards for the Age of AI haberi, CVE/CVSS benzeri guvenlik standartlarinin AI-agent risklerini kapsayacak sekilde baski altinda oldugunu gosteriyor. Kaynak: news.google.com

AI-SCIENCE

  • Claude Science, genomics, computational chemistry ve research workflow'larini tek workbench altinda topluyor; verification agent vurgusu bilimsel hallucination riskine dogrudan cevap. Kaynak: anthropic.com
  • OpenAI GeneBench-Pro, genomics/biology benchmark'ini daha zor gercek dunya veri setleriyle kuruyor. Kaynak: openai.com
  • LUMEN, systematic review/meta-analysis surecini cost-transparent multi-agent pipeline olarak ele aliyor; bilimsel literatur taramasi agent pazarinin sert use-case'lerinden biri olmaya devam ediyor. Kaynak: arxiv.org

INFRA

  • Etched'in inference chip cikisi, hardware roadmap'inde "model-specific accelerator" anlatısını guclendirdi. Kaynak: techcrunch.com
  • Coverage-Driven KV Cache Eviction, long-context inference'ta bellek-verimlilik dengesini KV cache kararlarina indiriyor. Kaynak: arxiv.org
  • Predict, Reuse, and Repair, dynamic sparse attention'da top-K KV block secimini hizlandirmaya odaklaniyor. Kaynak: arxiv.org

AI güvenliği

  • CAREBench, child-safety risk escalation'ini explicit harm oncesinde yakalamaya calisan benchmark yaklasimi sunuyor. Kaynak: arxiv.org
  • EvalSafetyGap, benchmark/reward/safety metric iyilesirken gercek guvenligin geride kalabilecegi olcum boslugunu tarif ediyor. Kaynak: arxiv.org
  • MemLeak, multimodal agent memory'de "silindi" denen bilginin image/multimodal temsil uzerinden sizmaya devam edebilecegini gosteriyor. Kaynak: arxiv.org

WATCHLIST

  • MCP metadata poisoning: Tool description guven zinciri icin allowlist, signed manifests ve runtime policy gerekli hale geliyor. Kaynak: news.google.com
  • Agent memory confounds: MemDelta ve Reclaim Evaluation, memory benchmark'larinda yanlis/eksik ozete dayali guven hatasini tekrar gundeme aliyor. Kaynak: arxiv.org ve arxiv.org
  • Mobile AI secret leakage: iOS AI app API key leak calismasi, mobile-side proxy ve key storage denetimini watchlist'e aliyor. Kaynak: news.google.com

TRENDS

  • Launches ve Regulation bugunku en yogun iki topic; "urun cikariyoruz" ve "bunu nasil yonetecegiz" ayni anda buyuyor. Kaynak: techcrunch.com ve news.google.com
  • Agent tooling trendi consumer surface'e indi: Cursor mobile, Acti keyboard agent ve shot-scraper video ayni gun farkli arayuzlerde agent kontrolunu gosterdi. Kaynak: webrazzi.com ve techcrunch.com ve simonwillison.net
  • Scientific agents trendi: Claude Science, GeneBench-Pro ve LUMEN ayni yonde; AI bilimi sadece cevap uretmekten workflow + verification + evidence synthesis hattina kayiyor. Kaynak: anthropic.com ve openai.com ve arxiv.org

Multimodal

  • DAIN, statik MoE yerine dinamik agent-based interaction network ile multimodal reasoning'i daha adaptif hale getirmeyi hedefliyor. Kaynak: arxiv.org
  • Latent Noise Mask, MLLM'lerde gereksiz gorsel token yogunlugunun fine-grained reasoning'i bozmasini azaltmaya odaklaniyor. Kaynak: arxiv.org
  • BrainJanus, brain-vision-language ekseninde anlama ve uretimi tek modelde birlestirmeye calisiyor. Kaynak: arxiv.org

Robotik & Embodied AI

  • Fast Enough to Act, low-latency robotic VLM/VLA icin spatio-temporal visual token merging oneriyor; robotikte inference hizinin task basarisina dogrudan etkisi var. Kaynak: arxiv.org
  • Early Warning Signals for OpenVLA Failure, VLA modellerinde visual distribution shift altinda hata oncesi sinyal yakalamayi hedefliyor. Kaynak: arxiv.org
  • Vision-Language-Action Models: Experimental Insights from a Real-World UR5 Platform, VLA modellerinin gercek robot platformuna transferini test ediyor. Kaynak: arxiv.org

Edge & Cihaz

  • JuZhou 1.0, China-developed AI accelerators uzerinde egitilen edge-native text-to-image foundation model olarak yerel accelerator ekosistemi sinyali veriyor. Kaynak: arxiv.org
  • Acti, AI agent'lari smartphone keyboard icine koyarak app-switching yerine input-layer agent deneyimi deniyor. Kaynak: techcrunch.com
  • HASTE, resource-constrained cihazlarda CNN compression'i training-free ve steerable hale getirmeye calisiyor. Kaynak: arxiv.org

Acik Kaynak

  • Claude Sonnet 5 GitHub Copilot'a genel kullanima geldi; coding workflow'unda model secimi artik IDE ve agent katmaninda hizli degisiyor. Kaynak: github.blog
  • LAMP, Lean + MCP + proof repair ile formal proof agent'lari icin acik bir agentic framework tasarlıyor. Kaynak: arxiv.org
  • SimpleX Chat, GitHub trending'de gizlilik odakli messaging altyapisiyla one cikti; AI disi ama privacy-first altyapi sinyali guclu. Kaynak: github.com

CikCik Paketi

  • Simon Willison, Claude Sonnet 5'in tokenizer degisimi nedeniyle Ingilizce/İspanyolca maliyet etkisini not etti; model fiyatina sadece list price degil tokenizer davranisi da giriyor. Kaynak: simonwillison.net
  • Simon Willison, shot-scraper video ile agent'larin kendi demo videolarini uretebilmesini gosterdi; CikCik icin "agent output proof" formatina donusturulebilir. Kaynak: simonwillison.net
  • Karpathy aynasindan Etched'in stealth'ten cikisi ve $1B+ kontrat duyurusu yayıldi; chip narrative sosyalde teknik merak cekiyor. Kaynak: x.com
  • Latent Space akisi "Sonnet 5 ships, X gets an MCP server, Codex gets buttons" paketini gundeme tasidi; X MCP konusu sosyal operasyonlar icin izlenmeli. Kaynak: mastodon.social
  • HN'de Claude Code steganography yazisi yuksek ilgi gordu; CikCik icin "AI tool trust" temasinda guclu tartisma malzemesi. Kaynak: thereallo.dev

Rehberler & Kaynaklar

  • Context Engineering for RAG, tek bir RAG cevabinin arkasindaki typed inputs modelini anlatiyor; internal RAG tasariminda yararli. Kaynak: towardsdatascience.com
  • Stop Choosing Between Local and Cloud LLMs, Gemma 4 + GPT-5.4 ile hybrid local-cloud workflow rehberi sunuyor. Kaynak: towardsdatascience.com
  • HTML table extractor, tarayicidan kopyalanan rich text/HTML tablolarini donusturmek icin pratik bir utility. Kaynak: simonwillison.net

Oracle Self-Improvement Sinyalleri

  • Agent memory paper yogunlugu, Oracle memory sisteminde "silindi/ozetlendi" bilgisinin dogruluk ve sızıntı testinden gecmesi gerektigini gosteriyor. Kaynak: arxiv.org ve arxiv.org
  • Context management paper'lari, uzun sessionlarda sadece compaction degil, agent'in kendi context dashboard sinyalini uretmesi gerektigini destekliyor. Kaynak: arxiv.org
  • PolicyGuard, sub-agent verifier modelini destekliyor: agent aksiyonlari yalnizca output kalitesiyle degil, system/policy uyumuyla da kontrol edilmeli. Kaynak: arxiv.org

Kaynak Ozeti

  • RSS/news: 2.106 ham, 232 unique; baskin kaynaklar DonanımHaber, The Register, Technopat. Kaynak: donanimhaber.com ve theregister.com
  • Search: 519 ham, 309 unique; Google News funding/AI/company akislari baskin, canonical URL cozumleme halen gerekli. Kaynak: news.google.com
  • Academic/API: 1.550 ham, 1.514 unique; arXiv cs.CV, cs.LG, cs.CL yogun. Kaynak: arxiv.org
  • Social: 4.131 ham, 656 unique; Twitter fallback gürültülü, Bluesky/Mastodon daha temiz sinyal verdi. Kaynak: bsky.app ve mastodon.social
  • Community: 65 ham, 47 unique; GitHub Trending, Lobsters ve Reddit ML ana sinyal verdi. Kaynak: github.com ve lobste.rs

Coverage / Blind Spots

  • Coverage tam: 5/5 kaynak ailesi kapsandi, 10/10 topic kapsandi, missing family yok. Kaynak: arxiv.org ve news.google.com ve github.com
  • Thin family yok; ancak social collector X fallback tarafinda eski x.com / Posts aggregator sonucunu fazla topluyor, kalite skoru dusurulmeli. Kaynak: news.google.com
  • Reddit tarafinda birkac kaynak 429 verdi; community coverage yine de GitHub/Lobsters/Reddit ML ile kapanmis durumda. Kaynak: reddit.com

Bu Gece Sistem Ne Ogrendi

  • Kalici ders: "Launches + Regulation + Models" uclusu tekrar baskin; pipeline bu uc ekseni ayri skorlamali. Kaynak: techcrunch.com ve news.google.com
  • Kalici ders: Search akisi aggregator linklerine dayaniyor; publish oncesi canonical URL resolver eklemek rapor kalitesini artirir. Kaynak: news.google.com
  • Kalici ders: Rising entities bugun Anthropic, AI Agents, RAG ve Amazon etrafinda toplandi; Oracle watchlist'e "agent runtime security", "scientific AI workbench" ve "FDE deployment model" eklenmeli. Kaynak: anthropic.com ve techcrunch.com

Dedupe & Kalite Notu

Bu rapordaki ana maddeler onceki 3 gunun raporlarindaki tekrarlar elenerek secildi. Ozellikle DSpark, California-Claude, Azure-GB300 ve temiz repo/malware maddeleri tekrar ana haber yapilmadi. Toplam 8.371 item islendi; merge sonrasi 6.894 kayit, dedupe sonrasi 2.758 benzersiz item kaldı. Dedupe sonucu: 4.127 fingerprint tekrar, 8 semantik tekrar, 1 guncelleme.