---
title: "AI Web Scraper Nedir ve Nasıl Çalışır?"
description: "AI web scraper, sayfadan veri çıkarma işini sabit seçici yerine yapay zekâya bırakan kazıyıcıdır. Çalışma adımlarını, araç türlerini ve sınırlarını anlatıyoruz."
url: https://proxynet.io/tr/blog/ai-web-scraper-how-it-works-2026
date: 2026-09-21
author: "Acar Diveroli"
category: "Web Scraping, Yapay Zekâ"
lang: tr
---

# AI Web Scraper Nedir ve Nasıl Çalışır?

Bir e-ticaret sitesinden ürün adı ve fiyatı toplayan betiğiniz aylarca sorunsuz çalıştı. Site tasarımını yeniledi, `<span class="price">` öğesi farklı bir bileşene taşındı ve betik aynı gece boş kayıtlar yazmaya başladı. Bu senaryonun klasik cevabı seçiciyi yeniden yazmaktır. AI web scraper'ın vaadi başka: sayfanın yapısı değişse de "ürün adını ve fiyatını bul" talimatının anlamını koruması.

Bu yazıda AI web scraper'ın ne olduğunu, bir sayfayı beş adımda nasıl yapılandırılmış veriye çevirdiğini, araçların dört türünü, hangi işlerde iyi sonuç verdiğini ve engellenme tarafında klasik bir scraper'dan farkı olup olmadığını anlatıyoruz. Yolu kendisi seçen, tıkladıkça ilerleyen ajanlı sürüm ayrı bir konudur; son bölümde ikisinin çizgisini belli edip o yazıya bağlıyoruz.

> **Not: Kısa cevap**
>
> AI web scraper, sayfadan alan çıkarma işini elle yazılmış CSS seçicisi ya da XPath yerine büyük bir dil modeline bırakan kazıyıcıdır. Sayfayı getirme, temizleme ve doğrulama adımları klasik kazımayla aynıdır; yalnızca "hangi öğenin veri olduğu" kararı modele geçer. Site tasarımı değiştiğinde betik bozulmaz, ama her sayfa için token ücreti ve çıktıyı denetleme yükü gelir.

## AI web scraper nedir?

Web kazıma iki ayrı iştir: sayfanın içeriğini **getirmek** ve gelen içerikten alanları **ayrıştırıp** yapılandırılmış veriye çevirmek. Bu ayrımı, bir modelin bu akıştaki gerçek yerini [GPT-6 Astra ile Web Kazıma](/tr/blog/gpt-6-astra-web-scraping) yazımızda model adına bağlı anlatmıştık; terim tarafı şurada. "AI web scraper" denince çoğu kişi bu iki işten **ayrıştırma** tarafını modele devreden aracı anlar. Getirme yine bir HTTP istemcisi ya da başsız tarayıcıyla yapılır; değişen, sayfanın hangi öğesinin "fiyat" ya da "stok" sayılacağına karar veren koddur.

Bu tanımın dışına çıkan iki durum karışıklık yaratır. Birincisi, hiç kod gerektirmeyen araçlar: bazı hizmetler sayfada istediğiniz alanları fareyle seçmenizi ve modelin seçiminizi genelleştirip benzer sayfalara uygulamasını istiyor. Kod yazmadan veri çekmenin tam merdivenini (Excel'den başsız tarayıcıya) [Web Sitesinden Veri Çekme](/tr/blog/extract-data-from-website) yazımızda sıralamıştık; AI scraper bu merdivenin en üst basamağına komşudur. İkincisi, yolu da modele bırakan ajanlı sistemler; onlar bu yazının değil [Agentic Web Scraping](/tr/blog/agentic-web-scraping-how-it-works-2026) yazısının konusu.

## AI scraper bir sayfayı nasıl veriye çevirir?

Araç markası ne olursa olsun, akış beş adımdan oluşur. Aradaki fark çoğunlukla bu adımların kaçının sizde, kaçının hizmette olduğudur.

1. **Sayfayı getir.** Statik HTML için basit bir HTTP isteği yeter. Sayfa içeriği JavaScript ile dolduruyorsa başsız tarayıcıyla render edilir. Bu adımda kullanılan IP, istek hızı ve tarayıcı parmak izi devrededir; modelin bunlarla ilgisi yoktur.
2. **Gürültüyü at.** Bir ürün sayfasının ham HTML'i, görünen metnin katbekat büyüklüğündedir; betik, stil ve gezinme blokları modele giderse hem yavaş hem pahalı olur. Script ve stil öğeleri temizlenir, gerekiyorsa yalnızca ana içerik bloğu çıkarılır. Mozilla'nın [Readability kütüphanesi](https://github.com/mozilla/readability), tarayıcının "okuyucu görünümü"nün arkasındaki algoritmanın açık kaynak hâlidir ve bu işin en bilinen referansıdır.
3. **Şemayı ve talimatı ver.** İstediğiniz alanları bir JSON şeması olarak tanımlarsınız: hangi alan zorunlu, hangisi sayı, hangisi tarih. Modern model API'leri [yapılandırılmış çıktı](https://platform.openai.com/docs/guides/structured-outputs) desteğiyle modelin yanıtını bu şemaya uymaya zorlar; metin olarak yazılmış serbest bir cevaptan farkı budur.
4. **Çıktıyı doğrula.** Şemaya uyan bir yanıt hâlâ yanlış olabilir: fiyat alanında "1.299 TL" metni gelir, para birimi kayıptır, stokta olmayan ürün "true" döner. Tür, aralık ve zorunlu alan kontrolleri kodla yapılır; şüpheli kayıt veritabanına değil ayrı bir kuyruğa yazılır.
5. **Kaydet ve ölç.** Geçerli kayıtlar depoya gider; boş dönen, düzeltme isteyen ve şemaya uymayan sayfa oranı izlenir. Bu oran sessizce yükseliyorsa ya site değişmiştir ya da model bu sayfa yapısını çözemiyor demektir; ikisi de yazdığınız kodun hatası değildir ve ancak ölçülerek görülür.

Üçüncü adımın sözleşmesi şöyle görünür. Şema:

```json
{
  "name": "string (zorunlu)",
  "price": "number (zorunlu)",
  "currency": "string",
  "in_stock": "boolean"
}
```

Modelin döndürmesi beklenen yanıt:

```json
{
  "name": "Kablosuz Mouse",
  "price": 1299,
  "currency": "TRY",
  "in_stock": true
}
```

## AI scraper türleri ve araçları

Piyasadaki araçlar dört gruba ayrılır. Birini seçerken sorulacak soru "hangisi en iyisi" değil, hangi adımların sizde hangilerinin hizmette kaldığıdır.

| Tür | Kod gerekir mi | Temsilci | Uygun iş |
|---|---|---|---|
| Kod gerektirmeyen araçlar | Hayır | Browse AI gibi izleme araçları | Tekrarlayan sayfa izleme, değişiklik uyarısı |
| AI ayrıştırmalı scraping API'leri | Uç nokta çağrısı düzeyinde | Firecrawl, Apify | Hazır entegrasyon, orta ölçekli işler |
| Kod tarafı kütüphaneler | Evet | ScrapeGraphAI, LangChain çıkarma zincirleri | Kendi hattını kuran, hattı özelleştiren ekipler |
| Ajan çerçeveleri | Evet | Browser Use, Playwright MCP | Yolu önceden bilinmeyen çok adımlı görevler |

Kısaca açalım. Firecrawl, bir URL alıp sayfayı dil modellerine uygun temiz Markdown'a ve istenirse şemalı JSON'a çeviren [açık kaynak bir kazıma API'sidir](https://github.com/firecrawl/firecrawl). Apify, hazır kazıma programlarının bulutta çalıştığı bir platformdur; yüzlerce hazır "actor" arasından seçip çalıştırırsınız. ScrapeGraphAI, getirme ve ayrıştırma hattını bir dil modelinin etrafında kuran açık kaynak bir Python kütüphanesidir; "bu siteden şu bilgileri çıkar" deyip hattın gerisini kütüphaneye bırakırsınız. LangChain ise genel amaçlı bir dil modeli çerçevesidir; belgelerden alan çıkaran zincirleri bu çerçevede kurarsınız. Dördüncü satır ise boru hattını terk eder: ajan çerçevelerinde model, hangi sayfaya gidip ne tıklayacağına da karar verir.

Tablodaki ilk iki grup işi hızlandırır, son ikisi işi tanımlama biçiminizi değiştirir. Çoğu ekip ikinci grupla başlar, ölçek ve özelleştirme arttıkça üçüncüye geçer; dördüncü grubun yeri ayrı bir yazıdır.

## Neyi iyi yapar, neyi yapamaz?

Model tabanlı ayrıştırmanın güçlü olduğu taraf, klasik betiğin kırıldığı yerdir:

- **Site değişikliğine dayanıklılık.** Tasarım yenilendiğinde, öğeler taşındığında ya da sınıf adları değiştiğinde talimat aynı kalır. Bakım listesinden "seçici düzeltme" kalemi silinmez ama seyrekleşir.
- **Uzun kuyruk siteler.** Yüzlerce farklı yapıda küçük site için ayrı ayrı seçici yazmak çoğu projede imkânsızdır; her birine aynı şemayı ve aynı talimatı vermek mümkündür.
- **Serbest metin.** "İki gün içinde kargo" cümlesinden teslim süresini, ilan açıklamasından daire katını çıkarmak seçiciyle yazılmaz; anlam çıkarma işidir.

Karşı tarafta üç kalıcı bedel vardır. **Maliyet ve hız:** seçici milisaniyelerde ve bedava çalışır; model saniyelerde ve her sayfa için token ister. Günde yüz bin sayfa işleyen sabit bir hatta bu fark tabloyu tersine çevirir. **Tutarlılık:** aynı girdi her seferinde aynı çıktıyı vermeyebilir; bu yüzden dördüncü adım atlanamaz. **Uydurma:** model, sayfada olmayan bir alanı kendi bilgisiyle doldurabilir. Yapıdaki bu iki risk nedeniyle, yapısı aylardır değişmeyen tek bir sitede [CSS seçicisi](/tr/blog/css-selector-vs-xpath) hâlâ en hızlı ve en ucuz çözümdür; AI burada bir iyileştirme değil, bir gider olur.

## Engellenme tarafında ne değişiyor?

Hiçbir şey değişmiyor, bir şey ağırlaşıyor. Model, sayfaya nasıl ulaşıldığını değiştirmediği için IP itibarı, istek hızı ve konum kısıtları klasik kazımayla aynıdır; dönen 429'un modelle ilgisi yoktur. Ağırlaşan kısım şu: AI scraper'lar JavaScript'i çözümleyebilmek için çoğunlukla başsız tarayıcıyla çalışır, yani her istek bir tarayıcı açar, çalıştırır ve kapatır. Bu, düz HTTP isteğinden daha yavaş ve daha belirgin bir ayak izidir; yoğun hızda çalıştırıldığında izin verilen istek sayısına daha çabuk takılır.

Bu nedenle AI scraper'da getirme katmanı eskisinden daha önemlidir. Başlangıç noktası hâlâ sitenin kendi kurallarıdır: `robots.txt` dosyası izin vermiyorsa kazıma yapılmaz, API'si olan site için API kullanılır, hız sınırına uyulur. Bunların çerçevesini [Web Scraping'de Engellenmeden Veri Toplama](/tr/blog/web-scraping-without-getting-blocked) yazımızda sıralamıştık. Hacimli ve dağınık işlerde istekler tek IP'den çıkarsa o adres hızla işaretlenir; gerçek kullanıcı adreslerinden gelen [Residential Proxy](https://proxynet.io/tr/residential-proxy) hedef sitenin güvenilirlik hesabında daha iyi bir konuma düşer, istek başına adresi değiştiren [Rotating Proxy](https://proxynet.io/tr/rotating-proxy) ise yükü havuza dağıtır. Sağlayıcı seçimini ayrı bir başlıkta ele aldık: [Web Scraping İçin En İyi Proxy'ler](/tr/blog/best-web-scraping-proxies-2026).

Kısacası "yapay zekâ ile kazıyınca engel yemiyorum" beklentisi yanlıştır; tam tersi, AI scraper tipik bir projede bot korumasına daha ağır görünen trafik gönderir. Getirme katmanı bu yüzden ayrı tasarlanır ve ayrı izlenir.

## AI scraper ile agentic scraping arasındaki fark ne?

İki terim sık karıştırılır çünkü ikisinde de sayfayı bir dil modeli okur. Fark, kararın kimde olduğundadır. AI web scraper sabit bir boru hattıdır: adımlar geliştirici tarafından yazılır, model yalnızca ayrıştırma adımında çalışır. Sayfa getirilir, ayrıştırılır, biter; akışın sonraki turuna model karar vermez.

Agentic web scraping'te model döngünün içindedir: hangi bağlantıya gireceğine, ne zaman duracağına, planın bozulup bozulmadığına kendisi karar verir. Bu, tek sayfalık işlerden çok adımlı görevlere geçiş demektir; bedeli maliyetin ve sürenin adım sayısına bağlanmasıdır. Genel ajan döngüsünün nasıl çalıştığını [AI Ajanları Nasıl Çalışır?](/tr/blog/how-ai-agents-work) yazımızda anlattık; kazımaya özgü hâlini, yapı taşlarını ve hata modlarını ise [Agentic Web Scraping](/tr/blog/agentic-web-scraping-how-it-works-2026) yazımızda ele aldık.

## Kullanım alanları

- **Fiyat ve stok izleme.** Yüzlerce satıcının ürün sayfası tek bir şemaya iner; tasarım değişiklikleri hat düşürmez. Uçtan uca kurulumu [Rakip Fiyat Takibi](/tr/blog/competitor-price-tracking) yazımızda anlattık.
- **Uzun kuyruk veri toplama.** Yüzlerce farklı yapıda küçük siteden aynı alanları çıkarmak, site başına seçici yazmaktan çok daha ucuza gelir.
- **Serbest metinden bilgi çıkarma.** Yorumlar, ilan açıklamaları, iş ilanları gibi yapısız metinlerde seçicinin yeri yoktur; çıkarılan alanlar [veri madenciliği](/tr/blog/what-is-data-mining) hattına girdi olur.
- **Dil modeli uygulamalarına güncel veri.** Ürün kataloğu, doküman ya da fiyat gibi güncel bilgilerin modele verilmesi gerekiyorsa AI scraper bu işi yapılandırılmış hâlde yapar; erişim katmanının güvenli kurgusu için [LLM'e Güvenli Web Erişimi](/tr/blog/llm-safe-web-access) yazımıza bakabilirsiniz.

## Sık yapılan hatalar

- **Her sayfayı modele göndermek.** Seçicinin çalıştığı kararlı bölge modele gitmemeli; kaba bir seçiciyle bölgeyi daraltıp içini modele bırakmak iki yöntemin avantajını birleştirir.
- **Ham HTML göndermek.** Betik ve stil blokları token bütçesini boşa harcar; temizleme adımı atlanırsa aynı iş birkaç kat pahalı çıkar.
- **Doğrulamasız çıktı.** Şemaya uymak verinin doğru olduğu anlamına gelmez. Tür, aralık ve zorunlu alan kontrolü olmadan modelin tek hatalı yanıtı veritabanınıza sessizce yazılır.
- **Şema tanımlamamak.** "Bu sayfadaki ürün bilgilerini ver" gibi serbest bir talimat, her sayfada farklı biçimde yanıtlanır; alan seti sözleşmeye bağlanmadan hattı kurmak boş iş.
- **Engel belirtilerini modele şifa etmek.** 429 yanıtı, boş içerik ya da CAPTCHA ayrıştırma sorunudur; prompt'u değiştirmek bunları çözmez, getirme katmanını (hız, IP stratejisi) düzeltmek çözer.
- **Gizli sayfaları üçüncü taraf araçta açmak.** Oturum gerektiren, kişisel veri içeren sayfaları kod gerektirmeyen bir hizmetin penceresine yüklemek o veriyi üçüncü tarafa taşır; bu tür sayfalar kendi altyapınızda işlenir.

## Karar rehberi

| İhtiyaç | Öneri |
|---|---|
| Tek, yapısı nadiren değişen sayfa; yüksek hacim | Klasik seçici; AI'ya gerek yok |
| Kod yazmadan tekrarlayan izleme | Kod gerektirmeyen araç |
| Site yapısı sık değişen, orta ölçekli iş | AI ayrıştırmalı API ya da kütüphane |
| Yüzlerce farklı yapıda site, serbest metin | LLM'li ayrıştırma + zorunlu doğrulama katmanı |
| Adımları önceden bilmeyen çok adımlı görev | Ajan çerçevesi ([Agentic Web Scraping](/tr/blog/agentic-web-scraping-how-it-works-2026)) |

## Sık sorulan sorular

### AI web scraper kullanmak için kod bilmek gerekiyor mu?

Gerekmeyebilir. Kod gerektirmeyen araçlar sayfada alan seçmenize ve tekrarlayan izleme kurmanıza izin verir; kod tarafı kütüphaneler ise hattı kendiniz kurmak isteyenlere esneklik verir. İş büyüdükçe ve özelleştirme ihtiyacı arttıkça kod tarafı kaçınılmazlaşır.

### AI scraper'lar klasik scraper'lardan daha mı kolay engellenir?

Engellenmenin nedeni model değil trafiğin kendisidir; ama AI scraper tipik olarak başsız tarayıcıyla çalıştığı için her istek daha yavaş ve daha belirgindir. Yoğun hızda bu, klasik düz istekten daha çabuk sınır takılmasına yol açabilir. Getirme katmanının ayrı tasarlanması bu yüzden önemli.

### Yapay zekâ ile veri çekmek yasal mı?

Yapay zekâ kullanımı hukuki soruyu değiştirmez: kişisel veri, oturum arkası içerik ve telif kuralları aynen geçerlidir; `robots.txt` ve site koşulları yine başlangıç noktasıdır. Çerçeveyi [Web Scraping Yasal mı?](/tr/blog/web-scraping-legal) yazımızda anlattık. Ek bir dikkat noktası: sayfa içeriğini üçüncü taraf bir model API'sine göndermek kendi başına bir veri aktarımıdır.

### ChatGPT ile web sitesinden veri çekebilir miyim?

Tek sayfalık küçük işler için evet: sayfayı tarayıcıdan kopyalayıp şemanızı vererek düzenlenmiş çıktı alabilirsiniz. Bu, boru hattı değildir; getirme yok, doğrulama yok, tekrar yok. Sürekli ya da çok sayfalı işlerde betik ve API çağrısıyla kurgulanmış bir hat gerekir.

### AI scraper'ın çıkardığı veriye güvenilir mi?

Şemaya uyan çıktı, doğru çıktı demek değildir. Tür ve zorunlu alan kontrolleri, aralık denetimleri ve örneklemle elle karşılaştırma standart uygulamadır; şüpheli kayıtlar ana depoya yazılmadan kuyruğa alınır. Güveni artıran şey modeli büyütmek değil, doğrulama katmanını ciddi kurmaktır.

### Hangi durumda klasik betik daha mantıklı?

Sayfa yapısı aylardır değişmeyen, hacmi yüksek ve alan seti sabit işlerde. Seçici milisaniyelerde ve token'sız çalışır; model burada bir iyileştirme değil kalıcı bir maliyettir. AI'ya, seçicinin kırıldığı istisnalar ve uzun kuyruk siteler ayrılmalıdır.

## Özetle

AI web scraper, kazımanın kırılgan ucunu — alan çıkarma işini — dile veriyor; getirme, doğrulama ve ölçme işleri klasik disiplinle aynı kalıyor. Kısa vadeli kazancı bakım listesinden silinen satırlar, bedeli her sayfa için ödenen token ücretidir. İkisini dengeleyen ekip, kararlı sayfalarda seçiciyi, değişken yapılarda modeli kullanır. Veri toplama hattınızı kurarken [veri kazıma çözümlerimize](/tr/data-scraping) göz atabilirsiniz.
