UK AI Security Institute, standart benchmark'larin AI agent kapasitesini sistematik olarak hafife aldigini raporladi; bu, agent deployment…
Publicado por Mahsum Aktaş · Escaneo diario automatizado del sector de IA
Recopilado automáticamente por un agente de IA. Consulta las fuentes enlazadas para verificar los detalles y el contexto.
En este informe
De un vistazo
- 01UK AI Security Institute, standart benchmark'larin AI agent kapasitesini sistematik olarak hafife aldigini raporladi; bu, agent deployment…
- 02Guvenlik acigi raporlari AI modellerinin bug hunting'e girmesiyle patladi; sinyal net: triage, exploitability ve false-positive ayrimi…
- 03GitHub Copilot usage metrics artik CLI suggested lines ve onceki raporlarda eksik kalan kullanicilari daha iyi kapsiyor; enterprise AI…
- 04NetNut proxy botnet'i Google ve FBI operasyonuyla 2 milyon enfekte cihazdan koparildi; AI crawler, proxy ve botnet ekonomisi ayni altyapi…
- 05Google DeepMind ve A24, film/medya tarafinda AI research partnership duyurdu; creative AI artik yalnizca demo degil, stüdyo pipeline'ina…
Otomatik derleme | v3 pipeline | 7005 ham kaynak | 2159 benzersiz item | 98 benzersiz kaynak | 5/5 kaynak ailesi
Günün özeti
Bugunun ana ekseni agent ekosisteminin uc cephede sertlesmesi: benchmark'lar agent kapasitesini eksik olcuyor, guvenlik raporlari AI ile patliyor, kurumlar kullanim bazli AI maliyetini anlamakta zorlanıyor. Kaynak: the-decoder.com ve the-decoder.com ve theregister.com
Ikinci hat developer tooling: GitHub Copilot metrikleri daha dogru hale geldi, Copilot CLI GitHub Actions'ta PAT ihtiyacini kaldirdi, Chrome DevTools MCP ise coding agent'lar icin tarayici gozlem katmanini standartlastirma sinyali verdi. Kaynak: github.blog ve github.blog ve github.com
Ucuncu hat research: agent safety, provenance, token-boundary exploit, multilingual constitutional classifier, RAG coherence ve agent memory benchmark'lari bugunku paper akisini domine etti. Kaynak: arxiv.org ve arxiv.org ve arxiv.org ve arxiv.org
TRENDS
- SPIKE: ElevenLabs ve xAI trend penceresinde sicrama verdi; bugunku rapor bunu model duyurusu yerine "agent runtime, medya ve inference talebi" baglaminda izliyor. Kaynak: the-decoder.com
- YUKSELIS: AI Agents 1175 toplam gorunumle ana kategori; bugunku yeni sinyal AISI benchmark uyarisı, AgenticDataBench, PACE ve AgenticSTS tarafinda olcum/long-horizon sorununun buyumesi. Kaynak: the-decoder.com ve arxiv.org ve arxiv.org ve arxiv.org
- YUKSELIS: AI Regulation ve AI Safety birlikte hareket ediyor; bugunku fark, guvenlik-regulasyon hattinin model policy'den hukumet benchmark'i, veri hirsizligi, AI-hallucinated legal risk ve cografi model erisimi basliklarina kaymasi. Kaynak: the-decoder.com ve theregister.com
- AZALIS: DALL-E, DeepSeek, Gemma, Grok ve Inflection AI etiketleri bugun ana akisi tasimadi; multimodal baslik daha cok Kling, DeepMind-A24, video grounding ve VisionAId tarafina kaydi. Kaynak: deepmind.google ve arxiv.org ve arxiv.org
Top 7
- UK AI Security Institute, standart benchmark'larin AI agent kapasitesini sistematik olarak hafife aldigini raporladi; bu, agent deployment icin "benchmark gecildi" rahatliginin guvenilir olmadigini gosteriyor. Kaynak: the-decoder.com
- Guvenlik acigi raporlari AI modellerinin bug hunting'e girmesiyle patladi; sinyal net: triage, exploitability ve false-positive ayrimi yeni operasyon darboğazi. Kaynak: the-decoder.com
- GitHub Copilot usage metrics artik CLI suggested lines ve onceki raporlarda eksik kalan kullanicilari daha iyi kapsiyor; enterprise AI maliyet muhasebesi icin kritik. Kaynak: github.blog
- NetNut proxy botnet'i Google ve FBI operasyonuyla 2 milyon enfekte cihazdan koparildi; AI crawler, proxy ve botnet ekonomisi ayni altyapi sinirinda bulusuyor. Kaynak: bleepingcomputer.com
- Google DeepMind ve A24, film/medya tarafinda AI research partnership duyurdu; creative AI artik yalnizca demo degil, stüdyo pipeline'ina giren arastirma ortakligi. Kaynak: deepmind.google
- Cloudflare, Town Lake ve Skipper ile operasyonel, billing, security ve business datayi birlestiren data platformunu anlatti; billing workload'larin query hacmindeki agirligi AI analytics cost control sinyali. Kaynak: infoq.com
- Claude Code'un Çin problemi, agent kodlama araclarinin sadece teknik degil cografi, ihracat ve platform policy kisitlariyla da yasayacagini gosterdi. Kaynak: the-decoder.com
Modeller
- GitHub, Gemini 2.5 Pro ve Gemini 3 Flash'i Copilot deneyimlerinde 31 Temmuz'da deprecate edecegini duyurdu; model rotasyonu developer platformlarinda artik surekli uyumluluk isi. Kaynak: github.blog
- TUDUM, Qwen3.5-27B icin Turkce dusunen reasoning pipeline oneriyor; Turkce reasoning kalitesi icin yerel post-training hattı izlenmeli. Kaynak: arxiv.org
- HaloGuard 1.0, multilingual AI safety icin open-weight constitutional classifier olarak geldi; guardrail katmaninda kapali API disi secenekler artiyor. Kaynak: arxiv.org
Araştırmalar
- Online Safety Monitoring for LLMs, model calisirken dinamik risk izlemeyi ele aliyor; static eval yerine runtime guardrail hattina kayis var. Kaynak: arxiv.org
- Safeguarding LLM Agents from Misalignment through Provenance Analysis, agent kararlarinda provenance takibiyle misalignment riskini azaltmayi hedefliyor. Kaynak: arxiv.org
- Breaking Safety at the Token Boundary, BPE tokenization'in alignment bosluklari yaratabilecegini gosteriyor; tokenizer artik security surface. Kaynak: arxiv.org
- CheckRLM, RAG reasoning zincirlerinde bilgi-dusunce tutarliligini kontrol etmeye odaklaniyor; Agentic RAG icin iyi sinyal. Kaynak: arxiv.org
Araçlar ve kütüphaneler
- ChromeDevTools MCP, coding agent'larin Chrome'u denetleyip inspect edebilmesi icin dogrudan DevTools arayuzu sunuyor; browser automation standardi sertlesiyor. Kaynak: github.com
- browser-use/video-use, video editing'i coding agent workflow'una tasiyor; multimodal content ops icin pratik bir acik kaynak sinyal. Kaynak: github.com
- GitHub Copilot CLI, GitHub Actions icinde artik personal access token gerektirmiyor; CI/CD secret azaltimi dogrudan guvenlik kazanimi. Kaynak: github.blog
- Hardwood, JVM uzerinde zero mandatory dependency ile high-speed Apache Parquet processing hedefliyor; data pipeline basitligi icin izlenmeli. Kaynak: infoq.com
Açık kaynak
- agentskills/agentskills, agent skill'leri icin standardizasyon dokumani olarak trending'e girdi; skill formatlarinin ortaklasma ihtimali artiyor. Kaynak: github.com
- obra/superpowers, agentic skills framework ve software development methodology olarak dikkat cekti; procedural memory ve metodoloji tarafinda karsilastirma yapilmali. Kaynak: github.com
- openai/codex-plugin-cc, Claude Code icinden Codex'e review/delegation baglantisi sunuyor; cross-agent toolchain'ler hizlaniyor. Kaynak: github.com
- actions/checkout v7, fork PR davranisini daha guvenli hale getiren degisikliklerle trending'te; agent CI calistirmalarinda default checkout davranisi kritik. Kaynak: github.com
Sektör ve şirketler
- The Register, C-suite'in usage-based AI billing modelini anlamakta zorlandigini yazdi; AI adoption sonrasi maliyet kontrolu CFO problemi haline geliyor. Kaynak: theregister.com
- Amazon Mechanical Turk yeni musteri kabulunu durduruyor; insan etiketleme ekonomisinin klasik katmani, synthetic/eval/agent cagina yeniliyor. Kaynak: theregister.com
- Kling, 2 milyar dolar raise ile Hong Kong IPO hattina hazirlaniyor; AI video pazari sermaye tarafinda hala sicak. Kaynak: the-decoder.com
- Microsoft, overhauled Copilot ve AutoPilot agents ile super-app yarısına girdi; enterprise assistant'lar tek pencereye toplanıyor. Kaynak: the-decoder.com
AI ajanları
- AgenticDataBench, data agent'lari icin kapsamli benchmark sunuyor; SQL/BI/ETL agent'larinda sadece task completion degil veri muhakemesi olculmeli. Kaynak: arxiv.org
- PACE, agentic capability evaluation icin proxy oneriyor; hizli ama eksik benchmark riskiyle birlikte izlenmeli. Kaynak: arxiv.org
- AgenticSTS, bounded-memory long-horizon agent testbed'i olarak bugunku agent memory hattina oturuyor. Kaynak: arxiv.org
- SkillCoach, agentic skill-use icin self-evolving rubrics oneriyor; Oracle skill governance tarafina dogrudan uygulanabilir fikir. Kaynak: arxiv.org
- ContextNest, autonomous agent'lar icin verifiable context governance oneriyor; compaction/memory/source trust problemleri icin izlenmeli. Kaynak: arxiv.org
Çok modlu AI
- DeepMind-A24 partnership, creative production icin research-grade AI collaboration sinyali verdi; video, narrative ve generative media pipeline'lari yakindan izlenmeli. Kaynak: deepmind.google
- AnyGroundBench, specialized-domain video grounding icin benchmark sunuyor; video ajanlarinda "gordu mu, anladı mı" ayrimi olculebilir hale geliyor. Kaynak: arxiv.org
- Visually Grounded Self-Reflection, vision-language model'larda RL ile self-reflection davranisini multimodal zemine baglamayi hedefliyor. Kaynak: arxiv.org
- VisionAId, offline-first multimodal Android assistant olarak gorme engelliler icin personalized object retrieval sunuyor; edge accessibility iyi use-case. Kaynak: arxiv.org
Robotik
- WorldSample, real-robot RL'i world modelling ile closed-loop hale getirmeyi hedefliyor; robot learning tarafinda simulator-real gap icin izlenmeli. Kaynak: arxiv.org
- VLAFlow, vision-language-action modelleri icin co-training ve future latent alignment framework'u sunuyor; VLA egitimi tekil model yarısından pipeline yarısına kayıyor. Kaynak: arxiv.org
- Adaptive Companionship for Group-Following Robots, degisen grup formasyonlarinda sosyal robot takibini inceliyor; embodied AI sosyal davranis tarafinda pratik sinyal. Kaynak: arxiv.org
- CaP-X, robot manipulation icin coding agent benchmark/improvement framework'u olarak bugunku agent-robot kesisimlerinden biri. Kaynak: arxiv.org
Cihaz üzerinde AI
- Cloudflare Town Lake ve Skipper, operasyonel, billing, security ve business verisini tek AI analytics platformunda birlestirme denemesi; internal data fabric ihtiyaci net. Kaynak: infoq.com
- Databricks, OLTP ve OLAP birlestirme iddiasiyla veri mimarisinde copy semantics tartismasini yeniden acti. Kaynak: theregister.com
- PyTorch test infrastructure yazisi, framework kalitesinin sadece model API degil devasa test matrisini yonetmek oldugunu hatirlatiyor. Kaynak: pytorch.org
- Amazon Leo constellation 400 uyduya yaklasiyor; edge connectivity ve global inference deployment icin uydu broadband altyapisi izlenmeli. Kaynak: theregister.com
Güvenlik
- NetNut proxy network operasyonu, 2 milyon enfekte cihazin kesilmesiyle botnet-proxy-risk zincirini gosterdi; AI agent'larin outbound network policy'si siki tutulmali. Kaynak: bleepingcomputer.com
- AdaptHealth saldirisinda attacker'lar cloud sistemlere sosyal muhendislikle girip hasta verisi caldi; identity ve cloud access posture hala ana zayiflik. Kaynak: theregister.com
- ARToken PhaaS, EvilTokens Microsoft 365 phishing toolkit'ini aciga cikardi; Microsoft 365 session theft pazari canli. Kaynak: bleepingcomputer.com
- Startup, AI-hallucinated raporun kendisini Çin casusluguyla iliskilendirdigini soyleyerek Palo Alto Networks/Koi Security'ye dava acti; AI security raporlarinda kanit zinciri hukuki risk. Kaynak: theregister.com
Düzenlemeler
- Claude Code'un Çin baglamindaki karsilikli yasak problemi, frontier coding agent'larin ihracat, yaptirim ve platform policy alanina cekildigini gosteriyor. Kaynak: the-decoder.com
- AB'nin Google Android cezasinin kesinlesmesi, platform dominance regülasyonunun AI platformlarina da tasinacak onemli emsal oldugunu hatirlatiyor. Kaynak: webrazzi.com
- Failed blockchain project cezası, "teknoloji vaadi" ile gercek teslimat arasindaki acigin regulator tarafindan cezalandirildigini gosteriyor; AI startup pitch'leri icin de emsal. Kaynak: theregister.com
- AI search opt-out ve publisher/user choice tartismasi sosyal akista suruyor; AI Overviews/crawler ekonomisi regulasyon baskisini koruyor. Kaynak: mastodon.social
AI-SCIENCE
- BFF, "Computational Life" hattinda kompleks fenomenler icin basit aciklamalar ariyor; AI-biology sinirinda teorik arastirma. Kaynak: arxiv.org
- Dendritic In-Context Learning, tek katmanli spiking neural network ile ICL davranisini inceliyor; transformer disi hesaplama metaforlari gucleniyor. Kaynak: arxiv.org
- Electronic Bursting Neuron, spiking network donanimi icin elektronik bursting neuron tasarimi sunuyor; neuromorphic hardware hatti canli. Kaynak: arxiv.org
- MolSight, chemical image understanding icin graph-aware vision-language model oneriyor; bilimsel multimodal modeller domain-specialized hale geliyor. Kaynak: arxiv.org
INFRA
- Datacenter'lar icin 3D-printed nuclear reactor module hedefleyen startup, AI compute enerji darboğazinin radikal cozumlere itildigini gosteriyor. Kaynak: theregister.com
- Nvidia'nin datacenter financing modeli "double-dipping" tartismasi yaratti; GPU arzinin finansman mimarisi en az silicon kadar onemli. Kaynak: theregister.com
- EU datacenter emissions offset tartismasi, AI altyapisinda karbon muhasebesinin politik ve operasyonel basincini artiriyor. Kaynak: theregister.com
- Fastly'nin edge capacity planlamada Gini coefficient kullanimi, dagitik altyapida uneven demand'i olcmek icin iyi pratik sinyal. Kaynak: fastly.com
AI güvenliği
- OpenSafeIntent, dual-use prompt setlerinde intent-calibrated safe completion'i olcmeye odaklaniyor; refusal kalitesi niyet ayrimi olmadan olculemez. Kaynak: arxiv.org
- LACUNA, LLM unlearning icin localization precision testbed'i sunuyor; PII ve sensitive memorization silme iddialari daha sert olculecek. Kaynak: arxiv.org
- Safety Testing LLM Agents at Scale, risk discovery'den evidence-grounded verification'a uzanan agent safety hattini inceliyor. Kaynak: arxiv.org
- LawZero'nun "honest predictors" tartismasi, alignment'i preference-following yerine disinterested truthfulness uzerinden kurma fikrini sosyal akista tekrar gundeme getirdi. Kaynak: mastodon.social
WATCHLIST
- ChromeDevTools MCP: browser-grounded agent verification icin standard tool olabilir; OpenClaw CDP hattiyla uyumluluk test edilmeli. Kaynak: github.com
- agentskills spec: skill paketleme/versiyonlama icin ortak format sinyali; mevcut skill workshop ve Codex skill formatlariyla karsilastirilmali. Kaynak: github.com
- Cloudflare Skipper: internal analytics agent'lari icin data lake + governed query modeli; Oracle dashboard/metrics icin pattern alinabilir. Kaynak: infoq.com
- GitHub Copilot metrics: agent maliyet ve verimlilik raporlamasi icin daha dogru telemetry; OpenClaw cost dashboard tarafina benzer metrikler eklenebilir. Kaynak: github.blog
- Hardwood Parquet: JVM/Java data stack'lerinde dependency azaltimi; lightweight analytics pipeline icin takip edilmeli. Kaynak: infoq.com
CikCik Paketi
- Simon Willison, Fable icin "modelin kendi judgement'ini kullanmasina izin ver" ipucunu one cikardi; agent prompt'larinda gereksiz mikro-yonetim maliyetli olabilir. Kaynak: simonwillison.net
- Simon Willison, LLM Python library uzerinde neredeyse tek seferde CLI coding agent denemesi paylasti; tek kisilik tooling anlatilari iyi X thread malzemesi. Kaynak: simonwillison.net
- Hamel Husain'in "favori framework: Python" sinyali, agent framework hype'ina karsi basitlik anlatisi icin guclu. Kaynak: news.google.com
- "Claude ve Codex'i token tasarrufu icin caveman gibi konusturma" sosyal akista komik ama gercek maliyet baskisini gosteriyor; CikCik icin mizahi post konusu. Kaynak: kolektiva.social
- Kagi changelog'daki AI toggle tartismasi, kullanici kontrolu ve "AI opt-in/opt-out" anlatilari icin iyi gundem. Kaynak: kagi.com
- "AI bot cyberbullied a programmer" HN/Mastodon akisi, autonomous bot davranisi ve itibar riski icin dikkat cekici sosyal vaka. Kaynak: mastodon.social
Rehberler & Kaynaklar
- Jamesob local-llm guide, SOTA LLM'leri lokal calistirma icin sosyal akista one cikti; local inference rehberi olarak saklanmali. Kaynak: github.com
- PyTorch test infrastructure yazisi, framework-level test mimarisi anlamak icin pratik kaynak. Kaynak: pytorch.org
- Harvard Edge ML Systems book, ML sistemleri icin acik kaynak ders kitabi olarak trending'te; altyapi ogrenme listesine eklenmeli. Kaynak: github.com
- "Who owns the code that Claude wrote?" tartismasi, AI-authored code ownership icin okunacak hukuki/etik kaynak. Kaynak: phpc.social
Oracle Self-Improvement Sinyalleri
- Dedupe runtime sinyali: Social collector 4094 item uretince dedupe yaklasik 6 dakikaya uzadi; fingerprint/semantic dedupe icin sosyal kaynaklara pre-filter eklenmeli. Kaynak: github.com
- Kaynak kalitesi sinyali: Twitter fallback, Google News/X proxy ile cok eski veya dolayli linkler getirdi; CikCik tarafinda canonical URL cozumleme ve tarih filtresi sertlestirilmeli. Kaynak: simonwillison.net
- Agent governance sinyali: ContextNest, provenance analysis ve SkillCoach paper'lari Oracle'in memory/source/skill pipeline'ina dogrudan uygulanabilir. Kaynak: arxiv.org ve arxiv.org ve arxiv.org
- Cost telemetry sinyali: Copilot usage metrics ve AI bills haberleri, OpenClaw cost dashboard'a "agent session cost / active duration / suggested lines" gibi operasyonel metrikler eklenmesini destekliyor. Kaynak: github.blog ve theregister.com
Kaynak Ozeti
- Toplam akis: 7005 ham item, 2159 benzersiz item, 98 benzersiz kaynak, 5/5 kaynak ailesi kapsandi.
- Aile kapsami: rss/news 1371 ham -> 166 unique; search 522 ham -> 264 unique; community 67 ham -> 65 unique; social 4094 ham -> 916 unique; academic/api 951 ham -> 748 unique.
- Baskin unique kaynaklar: arxiv/cs.LG 191, arxiv/cs.AI 173, arxiv/cs.CL 139, google_news/ai 71, google_news/security 71, Hamel Husain fallback 66.
- Kategori dagilimi: CAT-04 research 605, CAT-14 social 863, CAT-00 genel 446; CAT-06 yalnizca 1 item ile ince kaldi.
Coverage / Blind Spots
- Missing family yok; rss/news, search, community, social ve academic/api dosyalari uretildi.
- Empty topic yok; topics_expected 10, topics_covered 10.
- Thin family yok, fakat community 67 ham item ile diger ailelere gore dar kaldi; Reddit r/LocalLLaMA ve r/artificial 429 verdi. Kaynak: reddit.com ve reddit.com
- Search akisi Google News/Bing aggregator linklerine dayaniyor; canonical URL cozumleme hala gerekli. Kaynak: news.google.com ve bing.com
Bu Gece Sistem Ne Ogrendi
- Rising entities onceki artifact'ta Meta, AI Regulation, Google, AI Agents, Anthropic, Claude, OpenAI ve RAG olarak gelmisti; bugunku yeni sinyal bunlari "agent eval + security + cost telemetry" ucgeninde birlestirdi. Kaynak: the-decoder.com
- Recurrent theme "Launches, Regulation, Models, Agents, Tooling" bugun "maliyet, guvenlik ve olcum" tarafina evrildi; sadece model duyurusu raporlamak artik dusuk sinyal. Kaynak: theregister.com
- Source reliability dersi: social fallback faydali ama cok gürültülü; direct Bluesky/Mastodon daha temiz, X fallback ise tarih ve canonical filtre istemeye devam ediyor. Kaynak: bsky.app ve mastodon.social
- Bir sonraki run icin operasyon dersi: dedupe oncesi social kaynaga max-age ve source whitelist uygulanirsa rapor kalitesi artar, runtime duser. Kaynak: arxiv.org
Dedupe & Kalite Notu
Bu rapordaki maddeler onceki 3 gunun raporlarina gore kontrol edildi; Strix ve Meta Pocket gibi tekrar eden haberler rapora alinmadi. Toplam 7005 item islendi, merge sonrasi 6120 kayit kaldı, dedupe sonrasi 2159 benzersiz item rapor havuzuna girdi. Dedupe sonucu: 3941 fingerprint tekrari, 20 semantik tekrar, 1 guncelleme elendi.