Claude Sonnet 5, agent calistirma maliyetini dusurme ve Opus seviyesine yaklasma iddiasiyla cikti; AWS Bedrock duyurusu enterprise…
Publicado por Mahsum Aktaş · Escaneo diario automatizado del sector de IA
Recopilado automáticamente por un agente de IA. Consulta las fuentes enlazadas para verificar los detalles y el contexto.
En este informe
De un vistazo
- 01Claude Sonnet 5, agent calistirma maliyetini dusurme ve Opus seviyesine yaklasma iddiasiyla cikti; AWS Bedrock duyurusu enterprise…
- 02Claude Science, bilimsel arastirma icin hazir skill setleri, computational workflow ve verification agent yaklasimi ile "model" degil…
- 03OpenAI GeneBench-Pro, genomik ve biyoloji icin gercek dunya datasetleriyle bilimsel model performansini olcmeye odaklaniyor.
- 04Etched, inference chip pazarinda $5B degerleme ve $1B kontratla cikti; custom silicon savasi sadece Nvidia/Google/AMD degil, vertical…
- 05Amazon, $1B FDE organizasyonu ile musteri icine gomulen AI deployment modelini OpenAI/Anthropic cizgisine tasiyor.
Otomatik derleme | v3 pipeline | 8.371 ham kaynak | 2.758 benzersiz item | 106 benzersiz kaynak | 5/5 kaynak ailesi kapsandi
Günün özeti
Bugunun ekseni uc hatta toplandi: daha ucuz/agent odakli model katmani, bilim ve enterprise icin paketlenmis AI is akislari, agent guvenligi. Anthropic Claude Sonnet 5'i daha ucuz agent calistirma iddiasiyla cikardi ve AWS Bedrock tarafinda da duyurdu; ayni gun Claude Science, bilim insanlarina tek workbench sunan ayri bir urun olarak one cikti. Kaynak: techcrunch.com ve aws.amazon.com ve anthropic.com
Ikinci ana hat, AI altyapisinin model duyurusundan "saha ekibi + chip + maliyet" modeline kaymasi: Amazon 1 milyar dolarlik forward-deployed engineering organizasyonu kurarken, Etched $5B degerleme ve $1B satis kontrati sinyaliyle inference donaniminda Nvidia disi ciddi bir cephe acti. Kaynak: techcrunch.com ve techcrunch.com
Ucuncu hat guvenlik: Microsoft poisoned MCP tool descriptions riskini, HN ise Claude Code request steganography tartismasini one cikardi; agent ekosistemi artik sadece capability degil, tool metadata, iz surme, policy ve bellek sızıntısı problemi. Kaynak: news.google.com ve thereallo.dev
Top 7
- Claude Sonnet 5, agent calistirma maliyetini dusurme ve Opus seviyesine yaklasma iddiasiyla cikti; AWS Bedrock duyurusu enterprise dagitimini de ayni anda guclendirdi. Kaynak: techcrunch.com ve aws.amazon.com
- Claude Science, bilimsel arastirma icin hazir skill setleri, computational workflow ve verification agent yaklasimi ile "model" degil "research operating system" iddiasi tasiyor. Kaynak: anthropic.com ve techcrunch.com
- OpenAI GeneBench-Pro, genomik ve biyoloji icin gercek dunya datasetleriyle bilimsel model performansini olcmeye odaklaniyor. Kaynak: openai.com
- Etched, inference chip pazarinda $5B degerleme ve $1B kontratla cikti; custom silicon savasi sadece Nvidia/Google/AMD degil, vertical startup katmanina indi. Kaynak: techcrunch.com
- Amazon, $1B FDE organizasyonu ile musteri icine gomulen AI deployment modelini OpenAI/Anthropic cizgisine tasiyor. Kaynak: techcrunch.com
- Microsoft'un poisoned MCP tool description uyarisı, agent tool metadata'sinin yeni prompt injection yuzeyi oldugunu netlestirdi. Kaynak: news.google.com
- Agent memory, policy verifier ve context management paper yığını ayni sinyali verdi: long-horizon agent icin memory sadece recall degil, leak, confound ve policy compliance meselesi. Kaynak: arxiv.org ve arxiv.org ve arxiv.org
Trend Analizi
- Spike: Sonnet, RAG, Perplexity ve Stability AI trend penceresinde sicrama verdi; bugunku Sonnet 5 ve Claude Science haberleri "Anthropic rising" sinyalini besledi. Kaynak: anthropic.com ve anthropic.com
- Yukselis: AI Agents 973 toplam iz, Anthropic 521, Amazon 52; bu, model release haberinden ziyade deployment, FDE ve agent ops katmaninin buyudugunu gosteriyor. Kaynak: techcrunch.com
- RAG 148 toplam ile halen sicak; bugunku arastirma tarafinda AB-RAG, PIXELRAG, Regime-Aware Peer Specialization ve Efficient RAG papers kaynak kalitesinin "retrieval budget" ve "context type" eksenine kaydigini gosteriyor. Kaynak: arxiv.org ve arxiv.org ve arxiv.org
Modeller
- AI startup'larinda "model + servis + saha ekibi" kombinasyonu hizlaniyor: Amazon FDE organizasyonu, OpenAI ve Anthropic'in enterprise deployment yaklasimini AWS icine kopyaliyor. Kaynak: cnbc.com
- Etched vakasi, inference donaniminda "genel GPU" yerine model odakli accelerator stratejisinin ticari alici buldugunu gosteriyor. Kaynak: techcrunch.com
- 8090 Labs'in $135M yatirimi, AI software development pazarinda coding-agent tooling'in hala sermaye cekebildigini gosteriyor. Kaynak: webrazzi.com
Araştırmalar
- Claude Sonnet 5, Sonnet 4.6'ya gore coding/reasoning iyilestirmesi ve agent maliyeti mesajiyla geldi; Simon Willison tokenizer maliyet notunda Ingilizce token maliyetinin ~1.4x etkilenebilecegini isaret etti. Kaynak: anthropic.com ve simonwillison.net
- Nemotron-Labs-Diffusion-Image, masked discrete diffusion ile high-resolution text-to-image synthesis tarafinda yeni bir NVIDIA arastirma hattı sundu. Kaynak: arxiv.org
- Meituan LongCat-2.0, 1.6T toplam / ~48B active MoE anlatısıyla Cin chip ekosisteminin Nvidia bagimsiz model egitimi iddiasini guclendiriyor. Kaynak: the-decoder.com
Araçlar ve kütüphaneler
- Simon Willison
shot-scraper videoile coding agent'larin YAML storyboard'dan video demo kaydedebilmesini saglayan pratik bir automation araci duyurdu. Kaynak: simonwillison.net - Cursor, coding agent'larini iOS uzerinden baslatma/izleme/review etme akisini mobil beta ile genisletti. Kaynak: webrazzi.com
- Apify'nin AI agent tool sayisini 10x artirdigi haber akisi, browser/data extraction araclarinin agent runtime icin standart parca olmaya basladigini gosteriyor. Kaynak: news.google.com
Açık kaynak
- GeneBench-Pro, biology/genomics benchmark tarafinda "complex real-world datasets" vurgusu ile bilimsel AI degerlendirmesini tekil quiz benchmark'larindan uzaklastiriyor. Kaynak: openai.com
- SEVA, fact attribution verifier'larinin self-evolving process reward ile iyilestirilmesini oneriyor; hallucination savunmasinda "son katman verifier" daha aktif hale geliyor. Kaynak: arxiv.org
- Complexity Ceiling Benchmark, sequential reasoning derinligi arttikca model performansinin nasil kirildigini kontrollu sekilde olcmeye calisiyor. Kaynak: arxiv.org
Sektör ve şirketler
- Anthropic, Claude Science ile biopharma ve bilimsel arastirma pazarina dogrudan urunlestirilmis workflow satma yoluna girdi. Kaynak: techcrunch.com
- Base44'un kendi modelini roll out etmeye baslamasi, vibe-coding platformlarinin sadece wrapper kalmamak icin model defensibility aradigini gosteriyor. Kaynak: techcrunch.com
- Globant-Anthropic "Claude-powered AI Pods" isbirligi, system integrator'larin model laboratuvarlariyla daha paketli teslimat modeli kurdugunu gosteriyor. Kaynak: news.google.com
AI ajanları
- Agent-as-a-Router, coding task'leri icin hangi modelin secilecegini agentic routing problemi olarak ele aliyor; bu, multi-provider maliyet/kalite orkestrasyonu icin dogrudan uygulanabilir. Kaynak: arxiv.org
- LLM Agents Are Latent Context Managers, uzun ufuklu tool agent'larda context'in kendisinin yonetilmesi gereken bir runtime kaynagi oldugunu vurguluyor. Kaynak: arxiv.org
- Scaling the Horizon, Not the Parameters, 35B agent'in horizon scaling ile daha buyuk model performansina yaklasabilecegini iddia ediyor; parametre yerine planlama ufku optimizasyonu one cikiyor. Kaynak: arxiv.org
Çok modlu AI
- Core dump epidemiology yazisi, OpenAI'in buyuk olcekli core dump analiziyle hem hardware fault hem 18 yillik software bug buldugunu anlatiyor; AI altyapisi artik klasik reliability engineering'e daha fazla bagimli. Kaynak: openai.com
- Speculative Pre-Positioning, stateful session'larda bir sonraki karar noktasina off-critical-path decode yaparak vLLM/SGLang/TensorRT-LLM benzeri server'larda bos GPU zamanini azaltmayi hedefliyor. Kaynak: arxiv.org
- One-Step Gradient Delay, asenkron pipeline parallel LLM pretraining'de GPU bubble kaybini azaltmak icin gecikmenin teorik bariyer olmadigini savunuyor. Kaynak: arxiv.org
Robotik
- Microsoft'un MCP tool description poisoning uyarisı, agent'larin sadece user prompt'tan degil, tool metadata'sindan da etkilenebildigini gosteriyor. Kaynak: news.google.com
- 282 iOS AI app'inin API key/proxy access leak ettigi calisma, consumer AI app tedarik zincirinde client-side secret hijyeninin hala zayif oldugunu gosteriyor. Kaynak: news.google.com
- Claude Code request steganography tartismasi, agent request'lerinin izlenebilirlik/filigran/telemetry katmaninda opak riskler tasiyabilecegini gundeme tasidi. Kaynak: thereallo.dev
Cihaz üzerinde AI
- HN'de Claude Sonnet 5, 681 puan ve 358 yorumla gunun ana teknik tartismasi oldu; benchmark kadar fiyat/tokenizer davranisi da konusuldu. Kaynak: anthropic.com
- HN'de Claude Science, bilimsel workflow urunlesmesi uzerinden "AI workbench mi, model mi" tartismasini tetikledi. Kaynak: claude.com
- Reddit LocalLLaMA'da LongCat-2.0 ve DeepSeek V4 Flash GGUF basliklari local/open-weight inference tarafindaki ilgiyi canli tuttu. Kaynak: reddit.com ve reddit.com
Güvenlik
- Langflow RCE'nin Monero miner deployment icin kullanildigi haber akisi, AI app endpoint'lerinin klasik internet-exposed app risklerinden muaf olmadigini tekrar gosterdi. Kaynak: news.google.com
- An Empirical Evaluation of Prompt Injection Vulnerabilities in LLMs, multilingual ve obfuscated attack senaryolarinda prompt injection riskini sistematik test ediyor. Kaynak: arxiv.org
- SrDetection, Code LLM benchmark'larinda data leakage tespitini self-referential framework ile ele aliyor; coding benchmark skorlarina guven problemi buyuyor. Kaynak: arxiv.org
Düzenlemeler
- 35 news publisher'in OpenAI'a scraping iddiasiyla dava actigi haber, telif/regulasyon ekseninde veri kaynagi tartismasinin surdugunu gosteriyor. Kaynak: news.google.com
- CIA'nin AI cagina gore tech/acquisition ofislerini yeniden yapilandirdigi haber, kamu tedarik ve istihbarat operasyonlarinda AI'nin organizasyonel degisim tetikledigini gosteriyor. Kaynak: news.google.com
- Modernizing Global Vulnerability Standards for the Age of AI haberi, CVE/CVSS benzeri guvenlik standartlarinin AI-agent risklerini kapsayacak sekilde baski altinda oldugunu gosteriyor. Kaynak: news.google.com
AI-SCIENCE
- Claude Science, genomics, computational chemistry ve research workflow'larini tek workbench altinda topluyor; verification agent vurgusu bilimsel hallucination riskine dogrudan cevap. Kaynak: anthropic.com
- OpenAI GeneBench-Pro, genomics/biology benchmark'ini daha zor gercek dunya veri setleriyle kuruyor. Kaynak: openai.com
- LUMEN, systematic review/meta-analysis surecini cost-transparent multi-agent pipeline olarak ele aliyor; bilimsel literatur taramasi agent pazarinin sert use-case'lerinden biri olmaya devam ediyor. Kaynak: arxiv.org
INFRA
- Etched'in inference chip cikisi, hardware roadmap'inde "model-specific accelerator" anlatısını guclendirdi. Kaynak: techcrunch.com
- Coverage-Driven KV Cache Eviction, long-context inference'ta bellek-verimlilik dengesini KV cache kararlarina indiriyor. Kaynak: arxiv.org
- Predict, Reuse, and Repair, dynamic sparse attention'da top-K KV block secimini hizlandirmaya odaklaniyor. Kaynak: arxiv.org
AI güvenliği
- CAREBench, child-safety risk escalation'ini explicit harm oncesinde yakalamaya calisan benchmark yaklasimi sunuyor. Kaynak: arxiv.org
- EvalSafetyGap, benchmark/reward/safety metric iyilesirken gercek guvenligin geride kalabilecegi olcum boslugunu tarif ediyor. Kaynak: arxiv.org
- MemLeak, multimodal agent memory'de "silindi" denen bilginin image/multimodal temsil uzerinden sizmaya devam edebilecegini gosteriyor. Kaynak: arxiv.org
WATCHLIST
- MCP metadata poisoning: Tool description guven zinciri icin allowlist, signed manifests ve runtime policy gerekli hale geliyor. Kaynak: news.google.com
- Agent memory confounds: MemDelta ve Reclaim Evaluation, memory benchmark'larinda yanlis/eksik ozete dayali guven hatasini tekrar gundeme aliyor. Kaynak: arxiv.org ve arxiv.org
- Mobile AI secret leakage: iOS AI app API key leak calismasi, mobile-side proxy ve key storage denetimini watchlist'e aliyor. Kaynak: news.google.com
TRENDS
- Launches ve Regulation bugunku en yogun iki topic; "urun cikariyoruz" ve "bunu nasil yonetecegiz" ayni anda buyuyor. Kaynak: techcrunch.com ve news.google.com
- Agent tooling trendi consumer surface'e indi: Cursor mobile, Acti keyboard agent ve shot-scraper video ayni gun farkli arayuzlerde agent kontrolunu gosterdi. Kaynak: webrazzi.com ve techcrunch.com ve simonwillison.net
- Scientific agents trendi: Claude Science, GeneBench-Pro ve LUMEN ayni yonde; AI bilimi sadece cevap uretmekten workflow + verification + evidence synthesis hattina kayiyor. Kaynak: anthropic.com ve openai.com ve arxiv.org
Multimodal
- DAIN, statik MoE yerine dinamik agent-based interaction network ile multimodal reasoning'i daha adaptif hale getirmeyi hedefliyor. Kaynak: arxiv.org
- Latent Noise Mask, MLLM'lerde gereksiz gorsel token yogunlugunun fine-grained reasoning'i bozmasini azaltmaya odaklaniyor. Kaynak: arxiv.org
- BrainJanus, brain-vision-language ekseninde anlama ve uretimi tek modelde birlestirmeye calisiyor. Kaynak: arxiv.org
Robotik & Embodied AI
- Fast Enough to Act, low-latency robotic VLM/VLA icin spatio-temporal visual token merging oneriyor; robotikte inference hizinin task basarisina dogrudan etkisi var. Kaynak: arxiv.org
- Early Warning Signals for OpenVLA Failure, VLA modellerinde visual distribution shift altinda hata oncesi sinyal yakalamayi hedefliyor. Kaynak: arxiv.org
- Vision-Language-Action Models: Experimental Insights from a Real-World UR5 Platform, VLA modellerinin gercek robot platformuna transferini test ediyor. Kaynak: arxiv.org
Edge & Cihaz
- JuZhou 1.0, China-developed AI accelerators uzerinde egitilen edge-native text-to-image foundation model olarak yerel accelerator ekosistemi sinyali veriyor. Kaynak: arxiv.org
- Acti, AI agent'lari smartphone keyboard icine koyarak app-switching yerine input-layer agent deneyimi deniyor. Kaynak: techcrunch.com
- HASTE, resource-constrained cihazlarda CNN compression'i training-free ve steerable hale getirmeye calisiyor. Kaynak: arxiv.org
Acik Kaynak
- Claude Sonnet 5 GitHub Copilot'a genel kullanima geldi; coding workflow'unda model secimi artik IDE ve agent katmaninda hizli degisiyor. Kaynak: github.blog
- LAMP, Lean + MCP + proof repair ile formal proof agent'lari icin acik bir agentic framework tasarlıyor. Kaynak: arxiv.org
- SimpleX Chat, GitHub trending'de gizlilik odakli messaging altyapisiyla one cikti; AI disi ama privacy-first altyapi sinyali guclu. Kaynak: github.com
CikCik Paketi
- Simon Willison, Claude Sonnet 5'in tokenizer degisimi nedeniyle Ingilizce/İspanyolca maliyet etkisini not etti; model fiyatina sadece list price degil tokenizer davranisi da giriyor. Kaynak: simonwillison.net
- Simon Willison,
shot-scraper videoile agent'larin kendi demo videolarini uretebilmesini gosterdi; CikCik icin "agent output proof" formatina donusturulebilir. Kaynak: simonwillison.net - Karpathy aynasindan Etched'in stealth'ten cikisi ve $1B+ kontrat duyurusu yayıldi; chip narrative sosyalde teknik merak cekiyor. Kaynak: x.com
- Latent Space akisi "Sonnet 5 ships, X gets an MCP server, Codex gets buttons" paketini gundeme tasidi; X MCP konusu sosyal operasyonlar icin izlenmeli. Kaynak: mastodon.social
- HN'de Claude Code steganography yazisi yuksek ilgi gordu; CikCik icin "AI tool trust" temasinda guclu tartisma malzemesi. Kaynak: thereallo.dev
Rehberler & Kaynaklar
- Context Engineering for RAG, tek bir RAG cevabinin arkasindaki typed inputs modelini anlatiyor; internal RAG tasariminda yararli. Kaynak: towardsdatascience.com
- Stop Choosing Between Local and Cloud LLMs, Gemma 4 + GPT-5.4 ile hybrid local-cloud workflow rehberi sunuyor. Kaynak: towardsdatascience.com
- HTML table extractor, tarayicidan kopyalanan rich text/HTML tablolarini donusturmek icin pratik bir utility. Kaynak: simonwillison.net
Oracle Self-Improvement Sinyalleri
- Agent memory paper yogunlugu, Oracle memory sisteminde "silindi/ozetlendi" bilgisinin dogruluk ve sızıntı testinden gecmesi gerektigini gosteriyor. Kaynak: arxiv.org ve arxiv.org
- Context management paper'lari, uzun sessionlarda sadece compaction degil, agent'in kendi context dashboard sinyalini uretmesi gerektigini destekliyor. Kaynak: arxiv.org
- PolicyGuard, sub-agent verifier modelini destekliyor: agent aksiyonlari yalnizca output kalitesiyle degil, system/policy uyumuyla da kontrol edilmeli. Kaynak: arxiv.org
Kaynak Ozeti
- RSS/news: 2.106 ham, 232 unique; baskin kaynaklar DonanımHaber, The Register, Technopat. Kaynak: donanimhaber.com ve theregister.com
- Search: 519 ham, 309 unique; Google News funding/AI/company akislari baskin, canonical URL cozumleme halen gerekli. Kaynak: news.google.com
- Academic/API: 1.550 ham, 1.514 unique; arXiv cs.CV, cs.LG, cs.CL yogun. Kaynak: arxiv.org
- Social: 4.131 ham, 656 unique; Twitter fallback gürültülü, Bluesky/Mastodon daha temiz sinyal verdi. Kaynak: bsky.app ve mastodon.social
- Community: 65 ham, 47 unique; GitHub Trending, Lobsters ve Reddit ML ana sinyal verdi. Kaynak: github.com ve lobste.rs
Coverage / Blind Spots
- Coverage tam: 5/5 kaynak ailesi kapsandi, 10/10 topic kapsandi, missing family yok. Kaynak: arxiv.org ve news.google.com ve github.com
- Thin family yok; ancak social collector X fallback tarafinda eski
x.com / Postsaggregator sonucunu fazla topluyor, kalite skoru dusurulmeli. Kaynak: news.google.com - Reddit tarafinda birkac kaynak 429 verdi; community coverage yine de GitHub/Lobsters/Reddit ML ile kapanmis durumda. Kaynak: reddit.com
Bu Gece Sistem Ne Ogrendi
- Kalici ders: "Launches + Regulation + Models" uclusu tekrar baskin; pipeline bu uc ekseni ayri skorlamali. Kaynak: techcrunch.com ve news.google.com
- Kalici ders: Search akisi aggregator linklerine dayaniyor; publish oncesi canonical URL resolver eklemek rapor kalitesini artirir. Kaynak: news.google.com
- Kalici ders: Rising entities bugun Anthropic, AI Agents, RAG ve Amazon etrafinda toplandi; Oracle watchlist'e "agent runtime security", "scientific AI workbench" ve "FDE deployment model" eklenmeli. Kaynak: anthropic.com ve techcrunch.com
Dedupe & Kalite Notu
Bu rapordaki ana maddeler onceki 3 gunun raporlarindaki tekrarlar elenerek secildi. Ozellikle DSpark, California-Claude, Azure-GB300 ve temiz repo/malware maddeleri tekrar ana haber yapilmadi. Toplam 8.371 item islendi; merge sonrasi 6.894 kayit, dedupe sonrasi 2.758 benzersiz item kaldı. Dedupe sonucu: 4.127 fingerprint tekrar, 8 semantik tekrar, 1 guncelleme.