Editar PDF amb Nano PDF: guia completa per treure partit a la IA

Darrera actualització: 15 de desembre de 2025
  • Nano PDF permet editar i generar slides en PDF amb IA usant prompts en llenguatge natural, mantenint l'estil visual i la capa de text seleccionable.
  • L'eina combina Gemini 3 Pro Image, Poppler i Tesseract en un flux automatitzat que s'integra fàcilment a pipelins, scripts i orquestradors com n8n.
  • La seva naturalesa open source sota llicència MIT, la documentació en espanyol i el suport d'instruccions en el nostre idioma la fan especialment atractiva per a startups i equips tècnics hispanoparlants.
  • En un context on OpenAI i Google competeixen amb integracions d'Adobe i models avançats com Gemini, Nano PDF representa una opció transparent i altament automatitzable per a l'edició intel·ligent de PDFs.

Eina per editar PDF amb Nano PDF

Si portes temps barallant-te amb presentacions en PDF , pitch decks o documents que et fa mandra refer des de zero, Nano PDF pot convertir-se en la teva aliada secreta . Es tracta d'una eina pensada per editar PDFs amb IA sense tornar-te boig amb interfícies complexes ni perdre el format original dels fitxers.

La gràcia de tot això és que, en lloc de moure quadres de text o refent slides a mà, només has d'escriure allò que vols en llenguatge natural i l'eina s'encarrega de la resta. Per a founders, equips tècnics o developers que viuen entre automatitzacions, scripts i fluxos de treball al núvol, és una forma molt còmoda de ficar intel·ligència artificial en una cosa tan quotidiana com un PDF.

Què és Nano PDF i quin problema resol?

Nano PDF és una eina de línia d'ordres (CLI) dissenyada per editar arxius PDF, especialment presentacions i decks, usant instruccions en llenguatge natural. En lloc d'obrir un editor tradicional, treballes des de la terminal i defineixes què vols canviar mitjançant un prompt clar, com si ho demanessis a un assistent.

Està impulsada pel model Gemini 3 Pro Image de Google, conegut internament com a “Nano Banana” o “Nano Banana Pro” en algunes integracions, cosa que li permet comprendre tant el contingut visual com el text del PDF. Això vol dir que no només “llegeix” paraules, sinó que també interpreta gràfics, diagrames, composicions i estils.

L'eina està pensada principalment per a founders, equips tècnics i desenvolupadors que necessiten manipular documents de forma ràpida i escalable . És perfecta per als qui es mouen en entorns de CI/CD, automatitzacions amb scripts o eines com n8n i no volen dependre de solucions tancades o manuals.

Davant els típics editors de PDF d'escriptori, Nano PDF se centra en l'edició intel·ligent de slides i pàgines completes , mantenint l'aspecte professional del document i estalviant moltes hores de treball repetitiu.

Flux de treball per editar PDF amb Nano PDF

Com funciona Nano PDF per dins

Per aconseguir que un simple prompt del tipus “canvia aquest gràfic per un de barres amb dades del 2025” es converteixi en un PDF nou i coherent, Nano PDF encadena diversos passos tècnics força afinats . No fa màgia negra, però gairebé.

En primer lloc, les pàgines del PDF que es volen editar es converteixen en imatges usant Poppler. Aquesta conversió serveix perquè el model d'IA vegi la pàgina “com una diapositiva” completa, amb el disseny, els colors i la composició visual.

Opcionalment, pots indicar pàgines de referència d'estil (per exemple, la primera diapositiva d'un deck molt polit) mitjançant paràmetres com --style-refs "1,5". El sistema envia aquestes pàgines al model perquè entengui fonts, paleta de colors, distribució de blocs i, en general, la identitat visual del document.

A continuació, entra en acció Gemini 3 Pro Image . Amb les imatges de les pàgines i el teu prompt en llenguatge natural, el model genera noves versions d'aquestes pàgines ja amb els canvis sol·licitats: actualitzar un gràfic, introduir noves dades, modificar textos, canviar el tipus de gràfic o crear una slide completament nova.

Un cop generades les noves imatges, Nano PDF realitza un procés de “OCR re-hydration” amb Tesseract . Això vol dir que torna a afegir una capa de text seleccionable i cercable sobre la imatge generada, de manera que el PDF final no és només una imatge plana, sinó un document on pots seleccionar, copiar text i buscar termes i facilita processos com signar documents digitalment.

Finalment, l'eina recompon el PDF substituint les pàgines originals per les pàgines editades i conservant la resta de l'estructura del document. Tot això es fa amb processament en paral·lel per a diverses pàgines, de manera que la velocitat sigui raonable fins i tot en documents una mica llargs.

  OpenClaw: Guia Completa de Casos d'Ús i Estratègies de Seguretat per a Agents d'IA

Característiques clau en editar PDF amb Nano PDF

Una de les grans cartes de Nano PDF és la seva capacitat d' editar slides mitjançant instruccions en llenguatge natural . Podeu escriure coses de l'estil “actualitza la gràfica perquè inclogui dades del 2025” o “converteix aquest gràfic circular en un gràfic de barres” i la CLI s'encarrega de coordinar el model d'IA perquè el resultat respecti el disseny original.

També permet afegir noves pàgines o slides completes que encaixen amb lestil visual de la resta del document. Això és especialment útil quan tens un pitch deck força treballat i només vols incloure una secció nova sense que sembli que algú la va fer en una altra eina diferent.

La part de l' OCR re-hydration garanteix que el text segueix sent seleccionable . Després de passar pel model d'imatge, moltes eines es queden en un simple “pantallaç” del PDF, però aquí es recupera la capa de text perquè puguis copiar fragments, navegar amb cerca i no tinguis problemes d'accessibilitat bàsica.

Una altra característica diferenciadora és la capacitat de processar múltiples pàgines en paral·lel . Pots llançar una ordre que afecti diverses pàgines alhora i l'eina distribueix el treball concurrentment, reduint el temps total d'espera i permetent edicions massives.

A més, disposa d' configuració de resolució d'imatge mitjançant el paràmetre --resolution, amb valors com 4K (per defecte), 2K o 1K. Una resolució més alta implica millor qualitat i OCR més precís, encara que també més cost i temps de generació.

Integració amb IA i requisits tècnics

Per funcionar, Nano PDF es recolza en Gemini 3 Pro Image (Nano Banana / Nano Banana Pro) , un dels models multimodals avançats de Google. Aquest model entén tant imatges com a text i pot generar imatges noves coherents amb un estil visual donat, la qual cosa és perfecte per a PDFs amb dissenys complexos, taules i gràfics.

És important tenir en compte que necessites una clau API de Google Gemini amb facturació activada . Les claus del nivell gratuït no permeten la generació d'imatges, així que si intentes fer servir Nano PDF sense haver configurat un projecte amb billing a Google Cloud, no podràs treure-li partit de debò.

La configuració mínima inclou Python 3.10 o superior, a més de les dependències de sistema Poppler (per al renderitzat de PDF a imatge) i tesseract (per a l'OCR). Després d'instal·lar aquestes eines, sol ser recomanable reiniciar la terminal i comprovar amb ordres com which pdftotext y which tesseract que tot està correctament al PATH.

L'eina també contempla opcions de context com incloure el text complet del PDF a la petició al model. Amb banderes com --use-context o --no-use-context decideixes si Gemini rep una còpia del contingut textual del document per generar respostes més coherents. Per defecte, en ordres dedició simple el context sol anar desactivat, però en operacions dafegit de pàgines ve activat per millorar la rellevància.

Daltra banda, es pot controlar l'ús de cerca a Google per part del model amb banderes com --disable-google-search. D'aquesta manera tries si vols que la IA es limiti al contingut que li proporciones o pot ampliar informació consultant la web abans de generar contingut nou per al PDF.

Casos d'ús per a founders i equips tècnics

En el dia a dia d'una startup o equip de producte, els documents PDF són gairebé omnipresents: pitch decks, reports per a inversors, contractes, fitxes tècniques, documentació interna, etc. Amb Nano PDF, moltes d'aquestes tasques es poden automatitzar o, si més no, accelerar de manera considerable.

Un dels usos més clars és l' automatització de fluxos documentals . Pots integrar la CLI a scripts que generin, actualitzin i versionin presentacions sense tocar manualment una sola slide. Per exemple, refrescar trimestralment els gràfics de mètriques clau d'un deck d'inversors sense reobrir PowerPoint o Keynote.

A més, és molt útil per personalitzar documents en lot . Si la vostra startup envia propostes personalitzades a clients o partners, podeu mantenir un mateix disseny base i generar múltiples versions amb petits canvis de contingut, mantenint el format intacte. La IA s'encarrega que la maquetació no es trenqui.

  Tasques on ChatGPT falla i com no caure en els seus errors

Per a equips distribuïts, la integració en pipelins de CI/CD o eines d'orquestració com n8n obre moltes portes. Diversos desenvolupadors poden desencadenar l'edició d'un mateix PDF des de diferents parts del sistema, sense dependre d'un dissenyador únic o d'un lloc de treball concret amb programari d'escriptori instal·lat.

També encaixa molt bé en entorns on la documentació canvia ràpidament , per exemple, productes en iteració constant, on la documentació de funcionalitat, diagrames o comparatives es queden obsolets de seguida i cal actualitzar-los amb agilitat.

Exemple avançat: flux multi-agent amb n8n

Un cas especialment interessant és el d'un flux de treball multiagent muntat en n8n , pensat per generar PDFs educatius de temàtica històrica pràcticament en pilot automàtic. El sistema rep un tema com ara “Revolució Industrial”, “Apol·lo 11” o “Caiguda de l'Imperi Romà” i, després d'uns minuts, torna un PDF amb estructura de llibre de text, amb diversos capítols i abundant contingut visual.

Aquest flux crea un document HTML amb aparença professional , que després es transforma en PDF i es guarda directament a Google Drive . Cada capítol inclou text desenvolupat, elements visuals i s'integra de manera ordenada, mantenint un estil coherent a tot el document.

Per al control i l'escalabilitat, tot el procés es registra en un full de càlcul de Google ben organitzat . En comptes de tenir mil columnes estranyes per a cada imatge, el disseny opta per donar a cada imatge una fila pròpia, amb un estat i un ID principal que la vincula al job global del document. Això fa que el sistema sigui molt senzill d escalar i monitoritzar.

Pel que fa a costos, s'ha calculat que cada execució ronda els 0,51 € aproximadament , considerant un cost aproximat de deu cèntims per imatge generada. Per al tipus de PDF que s'obté –educatiu, ben maquetat i amb imatges històriques de qualitat–, el preu per document és molt competitiu.

En aquest flux es combinen diverses eines: n8n per a l'orquestració, credencials de Google per a fulls de càlcul i Drive, Gemini (gemini-flash-2.5 + nano-banana-pro) per a generació de contingut i imatges, OpenAI (GPT-5.1 amb cerca web) per a investigació addicional i ApiTemplate per convertir HTML a PDF . Hi ha fins i tot un vídeo on es mostra el flux pas a pas, explicant cada node i com es connecten tots els components.

Comparativa davant d'altres eines i ecosistema

Si compareu Nano PDF amb les clàssiques eines propietàries d'edició de PDF , l'enfocament canvia força. Aquí no tens una interfície plena de botons, sinó una CLI open source sota llicència MIT que aposta per la transparència i l'extensibilitat, ideal per a entorns tècnics que volen saber què passa per sota.

Una diferència important és que suporta instruccions en espanyol sense problemes , cosa que facilita la corba d'aprenentatge per a equips hispanoparlants, especialment a Llatinoamèrica i Espanya. No cal redactar-ho tot en anglès per aconseguir bons resultats d'edició.

Un altre plus és la reducció dràstica de temps en tasques repetitives . On abans calia obrir un editor, buscar la pàgina correcta, modificar a mà el gràfic o el text i reexportar el PDF, ara n'hi ha prou amb una ordre a la terminal. Això es nota molt quan cal mantenir al dia grans volums de documentació.

Paral·lelament, el mercat també s'està movent en altres direccions. Per exemple, OpenAI ha integrat versions d'Adobe Photoshop, Acrobat i Adobe Express dins de ChatGPT , permetent fer tasques d'edició d'imatges i PDFs mitjançant prompts conversacionals. Són versions retallades respecte a les apps d'escriptori, però molt útils per a usuaris no tècnics que s'emboliquen amb les interfícies clàssiques.

Tot i així, aquestes integracions d'Adobe a ChatGPT estan més pensades per a ús generalista: editar imatges, combinar PDFs, convertir documents i crear dissenys per a xarxes socials . Nano PDF, en canvi, es mou al terreny de l'automatització i els fluxos DevOps, on tot s'scriptitza i es connecta a pipelins, que és un enfocament més atractiu per a developers i startups tecnològiques.

  Com crear stickers de WhatsApp amb ChatGPT i eines de IA: Guia completa

Adobe, ChatGPT i la carrera amb Gemini

L'aparició d'eines com Nano PDF es dóna en un context de competència forta entre OpenAI i Google . Mentre Gemini ha avançat molt amb models com Gemini 3 i variants com Nano Banana Pro, OpenAI ha reaccionat integrant aplicacions de tercers com Adobe Acrobat dins de ChatGPT per reforçar el seu ecosistema.

Per utilitzar aquestes apps d'Adobe a ChatGPT, només cal esmentar-les pel seu nom juntament amb la teva petició i el fitxer que vols modificar . Per exemple, “Adobe Photoshop, ajuda'm a desenfocar el fons d'aquesta imatge” o “Adobe Acrobat, combina aquests PDF en un document”. Després d'invocar-les una vegada, no cal repetir el nom a cada missatge.

Aquestes integracions ofereixen interfícies simplificades amb controls com lliscants per ajustar paràmetres (brillantor, contrast, etc.) i opcions de resultat entre les quals l'usuari pot triar. No són les versions completes descriptori, però serveixen molt bé per a qui no és professional del disseny ni del tractament de PDF.

El funcionament cobreix diversos fronts: Photoshop dins de ChatGPT permet editar zones específiques, aplicar efectes creatius i ajustar la imatge ; Acrobat se centra a editar PDFs, comprimir-los, convertir formats, extreure taules o text i combinar diversos fitxers; Express es fa servir per generar i retocar dissenys tipus cartells, invitacions o gràfics per a xarxes socials.

Si en algun moment les funcions d'aquestes versions integrades es queden curtes, sempre es pot obrir el fitxer a l'app nativa d'escriptori i continuar treballant on el vas deixar . A nivell de desplegament, les apps d'Adobe per a ChatGPT estan arribant a la web, l'app d'escriptori i iOS, mentre que a Android algunes funcions, com les de Photoshop i Acrobat, van amb una mica de retard.

Open source, transparència i comunitat al voltant de Nano PDF

Un dels punts que més valoren els equips tècnics és que Nano PDF és open source i es distribueix sota llicència MIT . Això implica que pots revisar el codi, adaptar-lo a les teves necessitats particulars i fins i tot integrar-lo en solucions internes sense grans restriccions legals.

Aquesta obertura resulta especialment atractiva per a startups de LATAM i Espanya que prioritzen la transparència i volen auditar com es manegen els seus documents . No depens d'un “caixa negra” tancada, sinó d'un projecte on pots veure com es fan les trucades a l'API, com es processen els PDFs i què passa a cada pas del pipeline.

El repositori públic inclou documentació completa en espanyol , amb guies des de la instal·lació bàsica fins a exemples d'ús avançats a Linux, macOS i Windows. Això redueix la fricció inicial i elimina la típica barrera de documentació només en anglès que moltes vegades retarda l'adopció en contextos hispanoparlants.

A més, la pròpia eina fomenta integracions amb scripts no-code o low-code , connectant-se amb altres peces de l'ecosistema com n8n, sistemes interns de reporting o pipelins de CI/CD ja existents. Gràcies a la seva naturalesa CLI, és molt fàcil embolicar-la en contenidors, incloure-la a jobs programats o acoblar-la a esdeveniments concrets.

Com que és a GitHub, la comunitat pot aportar millores, pegats i noves funcionalitats . Això inclou des d'optimitzacions de rendiment en el processament paral·lel de pàgines fins a nous flags de configuració o exemples d'integració amb altres API.

Per a projectes on la documentació és un actiu estratègic i la IA es vol integrar de forma seriosa i escalable, combinacions com Nano PDF, models Gemini i fluxos automatitzats amb eines tipus n8n marquen clarament el camí . Permeten passar de processos manuals i dispersos a sistemes ben orquestrats, mesurables i fàcils de mantenir, on cada PDF deixa de ser una peça estàtica i es converteix en un recurs viu que evoluciona al mateix ritme que el producte o el negoci.

Word a PDF
Article relacionat:
Word a PDF: Eines i tècniques per a una conversió perfecta