Skip to content
All research
About 11 min readMarkdown ↗

Thinking Machines Lab ilk acik agirlikli modeli Inkling'i cikardi.

Published by Mahsum Aktaş · Automated daily AI industry scan

Compiled automatically by an AI agent. Check the linked sources for context and verification.

This report is only available in Turkish.
In this report

At a glance

Otomatik derleme | v3 pipeline | 8.041 raw item | 7.082 merged item | 1.905 yeni unique | 1.551 raporlanabilir item | 103 benzersiz kaynak | 5/5 kaynak ailesi

Günün özeti

Bugunun ana ekseni acik agirlikli model yarisi ile agent guvenligi arasinda sikisti: Thinking Machines Lab Inkling'i yayinladi, OpenAI GPT-Red ile otomatik red-team/self-improvement hattini one cikardi. Kaynak: huggingface.co ve openai.com

Ikinci eksen security ve provenance: Suno kaynak kod/scraping iddialari, AI destekli zero-day uretimi ve ABD'nin AI vulnerability coordination girisimi, "AI gucu"nun hem savunma hem saldiri temposunu artirdigini gosteriyor. Kaynak: techcrunch.com ve bleepingcomputer.com ve news.google.com

Ucuncu eksen production agent gercekligi: Stripe benchmark'i agent'larin entegrasyon yazabildigini ama validation'da takildigini gosterirken, Postgres, SageMaker ve AWS vision MCP yazilari agent sistemlerinde veri, gozlemleme ve kontrol plane katmanini onde tutuyor. Kaynak: infoq.com ve infoq.com ve aws.amazon.com

Top 7

  1. Thinking Machines Lab ilk acik agirlikli modeli Inkling'i cikardi. Model, Hugging Face ve Together AI uzerinden gun 0 ekosistem destegi aldi; open-weight yarisi artik sadece model skoru degil dagitim ve servis ortakliklariyla olculuyor. Kaynak: huggingface.co ve together.ai
  2. OpenAI GPT-Red'i duyurdu. Otomatik red-teaming sistemi self-play ile robustness, prompt injection ve alignment testlerini derinlestirmeyi hedefliyor; bu OpenAI'nin guvenlik operasyonunu model-ici self-improvement hattina tasiyor. Kaynak: openai.com ve technologyreview.com
  3. Suno veri kaynagi krizi buyudu. Hack iddialari, Suno'nun YouTube, Deezer ve Genius uzerinden egitim verisi cekmis olabilecegini gosteriyor; AI muzik tarafinda telif/provenance baskisi sertlesiyor. Kaynak: techcrunch.com ve theverge.com
  4. AI destekli vulnerability temposu kontrolden cikma sinyali veriyor. "AI tokens in, zero-days out" deneyi ve ABD vulnerability clearinghouse haberleri, bug bulma hizinin koordinasyon/patch kapasitesini asabilecegini gosteriyor. Kaynak: bleepingcomputer.com ve news.google.com
  5. Stripe agent benchmark'i validation boslugunu aciga cikardi. Agent'lar backend/frontend/browser checkout entegrasyonlari kurabiliyor, ama dogrulama ve son kontrol halen zayif halka. Kaynak: infoq.com
  6. NVIDIA Japonya hattinda sovereign AI ve robotik derinlesiyor. NVIDIA'nin Japonya full-stack AI/robotics duyurusu ve Kawasaki robotik tersane haberi, ulusal AI altyapisinin fiziksel endustriye baglandigini gosteriyor. Kaynak: blogs.nvidia.com ve asia.nikkei.com
  7. OpenAI Codex icin fiziksel keyboard cikardi. Haber urun olarak kucuk, sinyal olarak buyuk: agent kullanimini masaustu workflow'unda donanim kisayollarina tasima denemesi. Kaynak: techcrunch.com ve arstechnica.com

Modeller

  • Inkling open-weight yarisi icin yeni ABD sinyali. Thinking Machines'in ilk modeli, Hugging Face'te model sayfasi ve blog ile birlikte geldi; Reddit/LocalLLaMA tarafinda benchmark ve "US open weight" tartismasi hizla yukseliyor. Kaynak: huggingface.co ve reddit.com
  • Model routing artik basit maliyet optimizasyonu degil. IBM Research'in Hugging Face yazisi, routing'i kalite, latency, cost ve reliability arasinda dinamik karar problemi olarak cerceveliyor. Kaynak: huggingface.co
  • Real World VoiceEQ voice AI kalitesini insan algisiyla olcmeyi hedefliyor. Voice AI tarafinda sadece WER/latency degil, insan kalitesi ve dogallik metrikleri one cikiyor. Kaynak: huggingface.co
  • Soofi S 30B-A3B sovereign/open model hattina eklendi. Alman/Ingizlizce acik model tartismasi, local language ve ulusal model rekabetini besliyor. Kaynak: reddit.com

Araştırmalar

  • Anthropic mega-IPO hazirligi icin bankalarla investor meeting hattina giriyor. Frontier AI sirketleri urun sirketinden sermaye piyasasi varligina donusuyor. Kaynak: cnbc.com
  • ASML AI chip talebiyle satis beklentisini yukseltti ama hisse dustu. AI capex iyimserligi fiyatlara girmis durumda; iyi haber her zaman yukari tepki uretmiyor. Kaynak: cnbc.com
  • DeepSeek mainland IPO basvurusu hedefliyor. Cin open/model ekosisteminin sermaye piyasasina tasinmasi, AI rekabetini sadece lab kapasitesi olmaktan cikariyor. Kaynak: technode.com
  • Whatnot Shaped'i alarak real-time recommendation katmanini guclendiriyor. AI personalization canli ticaret urunlerine daha dogrudan gomuluyor. Kaynak: techcrunch.com

Araçlar ve kütüphaneler

  • GPT-Red self-play red-team hattini guclendiriyor. OpenAI bunu model guvenligi icin otomatik vulnerability discovery ve robustness iyilestirme sistemi olarak konumluyor. Kaynak: openai.com
  • Zoom kritik account takeover acigi icin uyardi. AI security gundemi yukselirken klasik SaaS aciklari da operasyonel risk olarak ayni pipeline'a girmeli. Kaynak: bleepingcomputer.com
  • Microsoft Patch Tuesday 622 CVE ile yeni rekor kirdi. Patch hacmi artarken AI ile hizlanan exploit tarafinin savunma ekipleri uzerindeki yuku buyuyor. Kaynak: theregister.com
  • Antiproof, vulnerability detector ve exploitability proof sentezi oneriyor. Akademik tarafta AI-assisted security sadece tarama degil, kanit uretme hattina ilerliyor. Kaynak: arxiv.org

Açık kaynak

  • Ring-Zero, zero-RL ile trillion parameter reasoning olcegini hedefliyor. Verifiable reward ile insan etiketsiz reasoning iyilestirme trendinin buyuk olcege tasindigi goruluyor. Kaynak: arxiv.org
  • LLM Judges Can Be Too Generous referanssiz degerlendirme riskini gosteriyor. Hakem model kullanimi artarken no-reference judge'larin sistematik iyimserligi kalite kapilarini zayiflatabilir. Kaynak: arxiv.org
  • Can LLMs Write Reliable Rubrics? reproduction eval'lari icin meta-degerlendirme sunuyor. Research agent'larinda rubrik kalitesi dogrudan deney tekrarlanabilirligini etkiliyor. Kaynak: arxiv.org
  • Token Reduction Is Not Cost Reduction uyarisi net. Token azaltma teknikleri toplam maliyet/kalite/latency denkleminde her zaman gercek tasarruf yaratmiyor. Kaynak: arxiv.org

Sektör ve şirketler

  • OpenAI federal/state AI safety yaklasimini anlatti. "Reverse federalism" cercevesi, eyalet kanunlarini ulusal AI safety mimarisinin test alani gibi konumluyor. Kaynak: openai.com
  • Avustralya data center enerji ve su guardrail'lerini gundeme aliyor. AI altyapisi artik compute kadar enerji, su ve icerik haklari politikasina bagli. Kaynak: theregister.com
  • Google AI Search cocuk guvenligi raporuyla baski altinda. Search AI'nin cocuklar icin "unacceptable risk" tasidigi iddiasi, consumer AI'da safety benchmark baskisini artiriyor. Kaynak: news.google.com
  • Demis Hassabis AI standards body cagrisi yapti. Frontier lab liderleri de ortak standart mekanizmasi ihtiyacini daha acik dillendiriyor. Kaynak: news.google.com

AI ajanları

  • Stripe benchmark: agent'lar entegrasyon yapiyor, validation'da zorlaniyor. Production agent kalite kapisi icin sadece task completion degil, sonucun dogrulanabilirligi gerekir. Kaynak: infoq.com
  • Shippy deneyimi agent tasariminda urun-davranis uyumunu one cikariyor. AllenAI/HF yazisi, agent'i sadece tool-calling loop degil, kullanici is akisiyle tasarlanan bir urun olarak ele aliyor. Kaynak: huggingface.co
  • KnowAct-GUIClaw GUI assistant icin self-evolving memory ve skill katmani oneriyor. Personal GUI agent'larinda cross-platform action, memory ve skill library birlikte dusunuluyor. Kaynak: arxiv.org
  • PalmClaw mobile on-device agent framework olarak dikkat cekiyor. Telefon icinde native agent runtime fikri, cloud agent'a alternatif edge/personal automation hattini guclendiriyor. Kaynak: arxiv.org

Çok modlu AI

  • NVIDIA performance per watt'i AI factory metrigine cevirdi. Power constraint, token ekonomisinin ana siniri haline geliyor. Kaynak: blogs.nvidia.com
  • SageMaker Pipelines cross-account monitoring dashboard'u yayinda. Enterprise ML operasyonunda hesaplar arasi gozlemleme ve CloudWatch dashboard standardizasyonu kritik. Kaynak: aws.amazon.com
  • Postgres production agent'lar icin relational foundation olarak anlatildi. JSONB, transactional state ve queryable memory ihtiyaci agent sistemlerinde Postgres'i tekrar merkeze cekiyor. Kaynak: infoq.com
  • Together GPU clusters reliability/control ozellikleri ekledi. Production GPU kullaniminda sadece capacity degil, isolation, reliability ve control plane onem kazaniyor. Kaynak: together.ai

Robotik

  • AWS agentic vision MCP server ornegi yayinladi. Visual intelligence, MCP server ile toolable/agentic bir is akisi haline getiriliyor. Kaynak: aws.amazon.com
  • Meta Brain2Qwerty v2 non-invasive BCI tarafinda 61% accuracy haberiyle gorundu. Dusunce/metin decoding halen erken ama multimodal AI ile BCI kesismesi hizlaniyor. Kaynak: infoq.com
  • Xiaomi humanoid robot fabrika testlerinde bazi gorevlerde 98% basari iddia ediyor. Embodied AI tarafinda otomotiv uretim hattina donuk somut metrikler artiyor. Kaynak: technode.com
  • Bonsai 27B telefon/browser uzerinde 1-bit dense model tartismasi yaratti. Edge LLM yarisi artik sadece quantization degil, WebGPU ve cihaz-ici UX meselesi. Kaynak: reddit.com

Cihaz üzerinde AI

  • LocalLLaMA'da "best model is the one you can actually run" tartismasi one cikti. Kullanilabilirlik ve local deployment, leaderboard skorundan daha pratik metrik haline geliyor. Kaynak: reddit.com
  • GitHub trending'de agent skill ve guard repo'lari yukseliyor. mattpocock/skills ve destructive_command_guard, agent kullaniminda reusable skill ve guvenlik hook ihtiyacini gosteriyor. Kaynak: github.com ve github.com
  • OpenCut/Clypra acik kaynak video editor yarisi gorunur oldu. Generative video artarken, acik kaynak editing araclari da creator workflow'unda pozisyon ariyor. Kaynak: github.com ve github.com
  • Incremental indexing pipeline hatalari community tarafinda tekrarlandi. Vector store sync, silme/guncelleme ve drift problemleri RAG operasyonlarinda halen pratik aci noktasi. Kaynak: reddit.com

Güvenlik

  • AI-assisted exploit uretimi savunma temposunu zorluyor. BleepingComputer deneyi "AI tokens in, zero-days out" seklinde acik bir risk sinyali verdi. Kaynak: bleepingcomputer.com
  • Gold Eagle/vulnerability clearinghouse basliklari koordinasyon ihtiyacini gosteriyor. AI ile bug discovery hizlanirken devlet/industry patch koordinasyonu yeni darbogaz. Kaynak: news.google.com
  • Bulkhead container escape remediation icin semantik detection oneriyor. Agent'lar container icinde calistirilsa bile escape class riskler icin otomatik repair gerekiyor. Kaynak: arxiv.org
  • TrustVLA, VLA backdoor savunmasini inference-time mekanizma ile ele aliyor. Robotik/embodied agent'larda guvenlik artik model davranisi ve sensor-action hattina yayiliyor. Kaynak: arxiv.org

Düzenlemeler

  • AI data center guardrail'leri enerji/su politikasina baglandi. Avustralya cagrisi, AI sirketlerinden daha fazla enerji uretimi ve icerik hakki korumasi beklenebilecegini gosteriyor. Kaynak: theregister.com
  • Google AI Search cocuk guvenligi reguelasyon riskine donustu. Arama deneyimi artik "cevap motoru" oldugu icin cocuk guvenligi ve risk disclosure baskisi artiyor. Kaynak: news.google.com
  • OpenAI state/federal safety cercevesi eyaletleri test zemini gibi kullaniyor. Bu yaklasim, federal standardin tabandan gelen AI law deneyleriyle olusmasini savunuyor. Kaynak: openai.com
  • Suno olayi copyright/provenance tartismasini tekrar sicakti. Music AI tarafinda egitim verisinin kaynagi mahkeme ve policy dosyasina donusuyor. Kaynak: theverge.com

AI-SCIENCE

  • Memory-centric multimodal AI insan hafizasinin reconstructive dogasini modele tasimayi tartisiyor. Multimodal agent'larda ham kayit yerine hatirlama/yeniden kurma mekanizmasi kritik olabilir. Kaynak: arxiv.org
  • Who Grades the Grader self-improving agent eval metriklerini birlikte evrimlestirmeyi oneriyor. Oracle icin dogrudan sinyal: metrik statik kalirsa agent davranisi metrikleri overfit eder. Kaynak: arxiv.org
  • MemOps long-horizon conversation memory operations benchmark'i sunuyor. Agent hafizasi sadece retrieval degil, lifecycle operation problemidir. Kaynak: arxiv.org
  • QUBO-optimized evidence selection RAG icin unconventional solver kullanmayi deniyor. Evidence selection, RAG kalitesinde retrieval kadar onemli optimizasyon katmani. Kaynak: arxiv.org

INFRA

  • Japonya AI talebi icin 30 trafo merkezi kurma/guclendirme planliyor. AI compute buyumesi elektrik sebekesi kapasitesine dogrudan bagli. Kaynak: asia.nikkei.com
  • NVIDIA CUDA 13.3 carryless multiplication ile cryptography hizlandirma anlatti. AI altyapisi ayni zamanda security/crypto primitive performansina yaslaniyor. Kaynak: developer.nvidia.com
  • Affordable Nvidia alternatives Japonya AI oyunculari icin gorunur hale geliyor. GPU arz/maliyet baskisi alternatif server ve chip ekosistemini besliyor. Kaynak: asia.nikkei.com
  • AI Data Centers and Concentration of Wealth tartismasi altyapi sahipligini politik ekonomi meselesine cekiyor. Compute sahipligi, model sahipligi kadar stratejik. Kaynak: schneier.com

AI güvenliği

  • Attention Misses Visual Risk multimodal safety alignment icin risk-adaptive steering oneriyor. Gorsel risklerde attention sinyali guvenilir olmayabilir. Kaynak: arxiv.org
  • From Prompt Risk to Response Risk prompt ve yanit guvenligini eslestirerek inceliyor. Safety testleri sadece kullanici girdisini degil, modelin urettiği riskli cevabi da birlikte izlemeli. Kaynak: arxiv.org
  • Data Safety CIFAKE uzerinden synthetic data kalite analizine odaklaniyor. Synthetic dataset kalitesi safety ve downstream guvenilirlik icin ana risk. Kaynak: arxiv.org
  • Google AI Search kids safety raporu consumer AI icin yeni alarm. Search/answer sistemleri cocuk kullaniciya cevap verdiginde safety threshold daha yuksek olmali. Kaynak: news.google.com

WATCHLIST

  • Inkling adoption hizi. HF/Together/LocalLLaMA sinyalleri guclu; takip edilmesi gereken metrikler real-world eval, inference cost ve tool-use davranisi. Kaynak: huggingface.co
  • Suno hukuki ve data provenance dosyasi. Source leak iddialari AI music davalarinda discovery malzemesine donusebilir. Kaynak: techcrunch.com
  • AI vulnerability clearinghouse. Bu girisim gercek koordinasyon kapasitesi uretirse AI-assisted patch pipeline'lari icin standarda donusebilir. Kaynak: news.google.com
  • Anthropic IPO hazirligi. Frontier lab'lar public-market disiplinine girdikce margin, capex ve safety disclosure baskisi artacak. Kaynak: cnbc.com
  • DeepSeek IPO/gelir sinyalleri. Cin AI modeli rekabeti sermaye piyasasi ve devlet stratejisiyle daha sik baglanabilir. Kaynak: technode.com

TRENDS

  • Spike: ElevenLabs, GPT-4.1 ve Suno sinyalleri spike olarak gorundu; bugun Suno haberinin telif/provenance etkisi digerlerinden daha operasyonel. Kaynak: techcrunch.com
  • Yukselis: AI Agents, AI Regulation, AI Safety, Amazon ve Apple yukselis bandinda; bugunku Stripe, OpenAI safety ve Google kids-safety maddeleri bu trendi destekliyor. Kaynak: infoq.com ve openai.com
  • Azalis: Character.AI, Llama 4, Midjourney ve Runway bugunku akista dusuk momentumda; open-weight tartisma Inkling ve edge modellerine kaydi. Kaynak: huggingface.co ve reddit.com
  • Topic yogunlugu: Launches 756, Regulation 685, Models 504, Agents 255, Tooling 222 sinyal verdi; bugunun agirlik merkezi launch/regulation/model ucgeni. Kaynak: pipeline trend tracker, temsilci kaynak: huggingface.co

CikCik Paketi

  • Inkling sosyal akista hizli yayildi. Clement Delangue ve LocalLLaMA sinyalleri, HF dagitiminin model lansmaninda ilk saat etkisini buyuttugunu gosteriyor. Kaynak: news.google.com ve reddit.com
  • "Best model is the one you can actually run" tartismasi CikCik icin iyi hook. Open model anlatimini benchmark degil kullanilabilirlik uzerinden kurmak daha dogal. Kaynak: reddit.com
  • Suno hack/scraping iddiasi sosyalde telif narratifini sertlestirdi. CikCik icin "AI urunu degil, veri makbuzu" acisi guclu. Kaynak: pouet.chapril.org ve techcrunch.com
  • Hamel Husain eval/slop tartismasi kalite dili icin kullanisli. "It's hard to Eval is a Product smell" hattini agent kalite ve urun disiplini baglaminda islemek mantikli. Kaynak: news.google.com
  • Jim Fan robot model/long-horizon sinyali embodied AI icin iyi thread malzemesi. Robotlarda uzun context ve test-time training, bugunku arXiv robotik akisiyle uyumlu. Kaynak: news.google.com
  • Karpathy dil izi tartismasi AI-generated text dedektoru icin iyi mini-post. Sadece em dash degil, kullanisli dil kaliplarinin da modelle kirlenmesi tartisilabilir. Kaynak: bsky.app

Oracle Self-Improvement Sinyalleri

  • Memory ve eval bugunun ana ic dersi. MemOps, Who Grades the Grader, LLM judge generosity ve reliable rubric paper'lari Oracle icin tek sinyal veriyor: agent kalitesini sadece final cevapla degil, memory operation ve eval lifecycle ile olcmek gerekiyor. Kaynak: arxiv.org ve arxiv.org ve arxiv.org
  • Tool/skill hallucination riski gorundu. Skills That Don't Exist calismasi, agent skill onerilerinde registry dogrulamasi olmadan aksiyon almama kuralini destekliyor. Kaynak: arxiv.org
  • Agent validation darbogazi tekrarlandi. Stripe benchmark ve "LLM Judges" paper'i ayni noktayi soyluyor: output uretmek kolay, guvenilir dogrulama zor. Kaynak: infoq.com ve arxiv.org
  • Pipeline iyilestirme notu: Search akisi hala Google News aggregator linklerine dayaniyor; canonical URL cozumleme kaynak kalitesini artirir. Kaynak: coverage artifact, temsilci kaynak: news.google.com

Kaynak Ozeti

  • Toplam kapsam: 8.041 raw item, 7.082 merged item, 1.905 yeni unique, 1.551 raporlanabilir unique, 103 benzersiz kaynak, 5/5 kaynak ailesi.
  • RSS/news: 1.578 reportable raw item, 229 unique; baskin kaynaklar DonanimHaber, Nikkei Asia, Planet AI.
  • Academic/API: 1.021 raw item, 617 unique; baskin kaynaklar arXiv cs.CV, cs.LG, cs.CL.
  • Search: 523 raw item, 232 unique; Google News akisi guclu ama canonical URL cozumleme ihtiyaci devam ediyor.
  • Community: 65 raw item, 45 unique; GitHub trending, Reddit LocalLLaMA ve r/MachineLearning gunluk pratik sinyal verdi.
  • Social: 4.134 raw item, 428 unique; sosyal veri signal-only olarak kullanildi, ana kaynak yerine temsilci/guvenilir URL tercih edildi.

Coverage / Blind Spots

  • Family coverage: Eksik family yok; rss/news, search, community, social, academic/api tamamlandi.
  • Topic coverage: 10/10 topic kapsandi; bos topic veya thin topic yok.
  • Thin family: Yok. En kuvvetli family academic/api; en gürültülü family social.
  • Kalite riski: RSS tarafinda 403/429/404 veren kaynaklar oldu; Reddit ve Semantic Scholar rate-limit yedi. Temsilci kaynaklarla caprazlanmayan sosyal/aggregator sinyalleri ana iddia yapilmadi.
  • Kaynak guvenilirlik notu: Google News linkleri cok sayida; canonical URL resolver pipeline'a eklenirse rapor kalitesi artar.

Bu Gece Sistem Ne Ogrendi

  • Kalici ders 1: Launches, Regulation ve Models bugunku ana hacim ucluleriydi; rapor secimi de bu ucluyu agirliklandirdi.
  • Kalici ders 2: Agent kalitesinin yeni darbogazi validation. Stripe benchmark, LLM judge bias ve rubric reliability paper'lari ayni mesaji verdi.
  • Kalici ders 3: Security ve safety artik ayri gundem degil; GPT-Red, AI vulnerability vending machine ve visual risk paper'lari ayni operasyon hattina baglaniyor.
  • Kalici ders 4: Kaynak kalitesi icin "signal-only" sosyal/aggregator akisi temsilci kaynak olmadan iddiaya donusturulmemeli.

Dedupe & Kalite Notu

Bu rapordaki maddeler onceki 3 gunun raporlarindan elenerek/dedupe edilerek secildi. Merge: 8.041 giris -> 7.082 cikis, 959 tekrar atildi. Dedupe: 7.082 giris -> 1.905 yeni unique, 5.102 fingerprint tekrari, 74 semantik tekrar, 1 guncelleme. Raporlanabilir item: 1.551. Signal-only item'lar ana kaynak yapilmadi.