Repository · Pronto
unclecode/crawl4ai
Analisi rapida del 19 settembre 2026, 05:42
- nuovi aggiornamenti al codice
- Stelle
- 84.048
- Licenza
- Apache-2.0
- Linguaggio
- Python
- Ultimo aggiornamento su GitHub
- 22 settembre 2026, 04:32
Voto complessivo: media pesata dei sei voti dell'analisi, da 1 a 10, 10 è meglio · stelle, licenza e date come le pubblica GitHub
Crawler Python auto-ospitato che apre pagine web, anche dinamiche, e le trasforma in Markdown o dati strutturati pronti per applicazioni IA.
Visita siti web usando browser Chromium, Firefox o WebKit, esegue JavaScript, gestisce sessioni, proxy e cache, ed estrae testo, link, immagini, tabelle, screenshot e PDF. Può produrre Markdown pulito, JSON tramite selettori CSS o XPath, oppure dati estratti con un modello linguistico. Offre anche CLI, API Docker e crawling di più pagine.
Categorie e capacità
Software auto-ospitato · Strumenti web senza registrazione
Uso
Adatto a
- Creare una base documentale per RAG partendo da siti web.
- Raccogliere prezzi, schede prodotto, tabelle o metadati da pagine web.
- Preparare dati per agenti IA, pipeline di dati e ricerche approfondite.
- Eseguire crawling locali o tramite un server Docker con API e dashboard di monitoraggio.
- Estrarre contenuti da pagine con caricamento dinamico, scroll infinito, iframe o Shadow DOM.
Non adatto a
- Piccoli script che devono scaricare solo poche pagine statiche senza usare un browser.
- Situazioni in cui non si possono installare Playwright, i browser e le relative dipendenze di sistema.
- Raccolte di dati che richiedono una fonte ufficiale, stabile e garantita: l'estrazione dipende dalla struttura dei siti visitati.
- Uso del server Docker esposto pubblicamente senza configurare correttamente autenticazione, rete e aggiornamenti di sicurezza.
Che cosa serve per usarlo
- Python >=3.10.
- Playwright e almeno un browser supportato; l'installazione può richiedere dipendenze di sistema.
- Per il server: Docker o Docker Compose, Redis incluso nella configurazione e risorse sufficienti.
- Per l'estrazione con LLM: un provider supportato e le relative credenziali, se richieste.
- Per funzioni opzionali: dipendenze aggiuntive come PyTorch, Transformers, Selenium o pypdf.
Che cosa può andare storto
- Il progetto è ancora classificato come Beta nel manifesto Python.
- Il funzionamento completo richiede Python 3.10 o superiore e l'installazione dei browser Playwright.
- L'estrazione con modelli linguistici richiede un provider compatibile e, in genere, una chiave API.
- Le modifiche alla struttura dei siti possono rompere selettori CSS, XPath e schemi di estrazione.
- Il crawling con browser può richiedere molta memoria e risorse; l'immagine Docker segnala un requisito operativo di almeno 2 GB di RAM.
- Le versioni recenti hanno corretto diverse vulnerabilità nel server Docker e nel trattamento dei PDF; l'aggiornamento resta importante.
- Il progetto ha corretto vulnerabilità recenti che includevano scrittura arbitraria di file, SSRF, XSS, esecuzione di codice e denial of service.
- Il crawler può accedere a siti esterni, proxy, file locali e servizi configurati dall'utente: una configurazione errata può ampliare la superficie di attacco.
- Le dipendenze sono numerose e includono browser, Redis, librerie PDF, librerie IA e provider esterni.
- L'uso di modelli linguistici può inviare contenuti estratti a servizi terzi, secondo il provider configurato.
- Il rispetto dei termini d'uso, dei limiti e delle regole dei siti visitati resta a carico di chi lo adotta.
- La versione dichiarata è Apache-2.0, ma il dossier non verifica eventuali vincoli specifici delle dipendenze transitive.
Valutazione
-
Qualità tecnica8
Il progetto ha una struttura ampia, configurazione Python moderna, numerosi test unitari, di integrazione, Docker, sicurezza e carico. La complessità è elevata e nel dossier non sono riportati risultati automatici della CI.
-
Maturità8
È stato creato nel 2024, ha 83.840 stelle, 8.669 fork e una versione pubblicata v0.9.3. Resta però classificato come Beta e non ha ancora raggiunto la versione 1.0.
-
Documentazione8
Il README contiene installazione, esempi Python, CLI, Docker, estrazione LLM e deployment. L'albero include una documentazione molto ampia, anche se il README segnala una riorganizzazione della documentazione in corso.
-
Facilità di integrazione6
Si può usare con pip, CLI, API REST o Docker, ma richiede browser Playwright, dipendenze di sistema e spesso molta memoria. Le funzioni LLM aggiungono provider, configurazione e possibili costi esterni.
-
Cura della manutenzione9
Il repository non è archiviato, ha 201 questioni aperte, una versione recente e una lunga serie di rilasci con correzioni e aggiornamenti di sicurezza. La data di ultima modifica pubblicata da GitHub indica attività recente.
-
Sicurezza e rischi6
La licenza Apache-2.0 e il Docker configurato con utente non root, filesystem in sola lettura, limiti e autenticazione sono elementi positivi. Il punteggio resta moderato perché il progetto ha corretto più vulnerabilità rilevanti e tratta contenuti, URL, PDF, browser e credenziali esterni.
Fatti tecnici
| Descrizione su GitHub | 🚀🤖 Crawl4AI: Open-source LLM Friendly Web Crawler & Scraper. Don't be shy, join here: https://discord.gg/jP8KfhDhyN |
| Ultima versione pubblicata | v0.9.3 |
| Copie derivate | 8.689 |
| Segnalazioni aperte | 201 |
| Argomenti | non pubblicato |
| Ramo predefinito | main |
| Creato su GitHub | 9 maggio 2024, 11:48 |
| Pagina del progetto | https://crawl4ai.com |
| File nell'albero | 1.068 |
Alternative interne
- browser-use/browser-use — Può automatizzare browser e siti web per agenti, ma Crawl4AI è più orientato alla raccolta massiva e all'estrazione di contenuti strutturati.
- vercel-labs/agent-browser — Offre automazione del browser per agenti; può sostituire Crawl4AI quando serve controllare una pagina, ma non copre allo stesso modo Markdown, crawling profondo e pipeline di estrazione.
Fonti usate
- Fatti pubblicati da GitHub su unclecode/crawl4ai
- README del progetto
- Manifesto Dockerfile
- Manifesto docker-compose.yml
- Manifesto pyproject.toml
- Manifesto requirements.txt
- Manifesto setup.py
- Albero dei file (1068 percorsi)
Quello che l'analisi ha davvero letto. L'analisi approfondita aggiunge il codice da cui si entra nel progetto, lo storico delle versioni, le segnalazioni e quello che se ne dice fuori da GitHub.
Note
Quello che hai visto provandolo. Le note non cambiano i voti dell'analisi e restano qui anche se scarti il repository.
Nessuna nota ancora.
Freschezza
- Ultima analisi
- Analisi rapida del 19 settembre 2026, 05:42
- Ultimo controllo su GitHub
- 22 settembre 2026, 07:37
- Cambiamenti dopo l'ultima analisi
- nuovi aggiornamenti al codice
Il controllo guarda quello che GitHub pubblica: nessuna intelligenza artificiale, nessuna spesa. Archiviato su GitHub, licenza cambiata o versione principale nuova rendono la scheda «Da riverificare»; nuovo codice, README e argomenti restano un avviso. Una nuova analisi azzera gli avvisi.
Analisi
Analisi rapida del 19 settembre 2026, 05:42.
- Costo di questa analisi
- 0,011784 USD
- Testo elaborato
- 35.182 token in ingresso, 2.842 token in uscita
Il costo comprende tutto quello che questa analisi ha chiesto all'intelligenza artificiale: la scheda, la ricerca delle fonti esterne e il riassunto dei cambiamenti.
In tutto il catalogo: 42 schede da analisi rapida, nessuna scheda da analisi approfondita.
Il costo medio di un'analisi approfondita non è ancora disponibile: nessuna analisi ha registrato il costo.
Che cosa leggono le due analisi
Analisi rapida. Legge la scheda pubblica di GitHub, il file di presentazione, l'elenco dei file e i file di configurazione, poi fa una domanda al modello.
Analisi approfondita. Aggiunge i file da cui si entra nel programma, il diario delle modifiche, le ultime 10 versioni con le loro note, 30 segnalazioni aperte e 30 chiuse e 10 discussioni. Cerca inoltre su internet che cosa si dice del progetto fuori da GitHub. Solo dopo rifà la scheda da zero: due domande al modello, più una terza per raccontare che cosa è cambiato.
La scheda non acquista campi in più: voti, capacità e usi restano gli stessi. Cambiano le informazioni su cui sono fondati, visibili nella sezione «Fonti usate».
1 esecuzione ▾
- Analisi rapida · 19 settembre 2026, 05:42 — completata