Le HTML est le balisage du web, avec des titres et des tableaux natifs. Le PDF est une mise en page figée, sans structure de titres sur laquelle une machine puisse s'appuyer. calibre se tient entre les deux, et cette page dit exactement ce qui arrive à un fichier HTML en route vers le PDF.
Ce qui s'exécute quand un fichier HTML devient un PDF
calibre le binaire ebook-convert, sur une machine que nous louons et que nous surveillons. Votre fichier HTML est envoyé une fois, calibre s'exécute une fois, le fichier PDF revient, et aucun des deux fichiers n'est conservé. HTML vers PDF fait partie des 3649 paires sur lesquelles ce moteur a été sondé avec un vrai fichier, et c'est pour cela que cette page existe quand celles que la sonde n'a pas su prouver n'existent pas.
Ce qui survit du fichier HTML dans le fichier PDF
L'ordre de lecture et le découpage en chapitres du fichier HTML. calibre le reconstruit comme un livre en route vers le PDF, et non comme un tas de pages.
Les images du fichier HTML, posées dans le PDF à l'endroit du texte qui les appelle.
Ce que la conversion HTML vers PDF vous coûte
Vos sauts de page, parce qu'un fichier HTML n'en a jamais eu. calibre redistribue d'abord le texte et calcule les pages du PDF à partir du résultat : la fin d'une page est une décision du moteur et non de l'auteur.
Tout ce vers quoi le fichier HTML pointait. calibre s'exécute ici avec une récursion nulle, aucun lien à l'intérieur du HTML n'est donc suivi. C'est ce qui empêche un fichier HTML venu d'un inconnu d'attirer les fichiers du serveur lui-même dans le PDF.
Si un modèle doit lire le fichier PDF
À savoir avant que ce PDF n'approche un assistant : c'est le mauvais sens. Un PDF est un ensemble de glyphes positionnés, et un modèle doit reconstruire l'ordre de lecture avant même de commencer. Si ce fichier HTML doit être lu par une machine plutôt que par une personne, convertissez-le en Markdown : la reconstruction disparaît.
HTML vers PDF, mesuré plutôt que promis
En passant HTML vers PDF sur le moteur réel avec un vrai fichier, calibre a écrit 25 178 octets au format PDF en 1,9 secondes, machine par ailleurs au repos. C'est un fichier HTML un jour donné et non une moyenne, et c'est pourquoi le nombre est donné avec le fichier qui l'a produit.
Le verdict HTML vers PDF a été obtenu par une signature de format, c'est-à-dire que au moins quatre octets propres au format ont été trouvés au bon décalage. Le contrôle employé compte, parce qu'ils ne prouvent pas tous la même chose, et un code de statut 200 ne prouve strictement rien sur ce que le fichier PDF contient.
Le même fichier HTML, envoyé ailleurs
Les autres sorties que la sonde a mesurées à partir d'un fichier HTML, pour que le coût du choix du format PDF se lise face à quelque chose. Les tailles ne se comparent pas d'un moteur à l'autre, chaque famille ayant été sondée avec son propre fichier témoin HTML.
HTML vers MD : 371 octets en moins d'un dixième de seconde, vérifié par un aller-retour pandoc.
HTML vers DOCX : 10 277 octets en 0,1 secondes, vérifié par un aller-retour pandoc.
HTML vers EPUB : 5 027 octets en 0,1 secondes, vérifié par un aller-retour pandoc.
HTML vers TXT : 270 octets en moins d'un dixième de seconde, vérifié par la relecture du texte.
HTML vers RTF : 775 octets en moins d'un dixième de seconde, vérifié par un aller-retour pandoc.
HTML vers ODT : 7 629 octets en 0,1 secondes, vérifié par un aller-retour pandoc.
Les autres routes vers PDF, et ce qu'elles ont mesuré
Parmi les routes publiées vers PDF, HTML est la 11e plus grosse sortie des 26 mesurées. Les fichiers témoins diffèrent : ce classement porte sur la sonde et non sur votre document.
TXT vers PDF : 12 976 octets en 1,8 secondes.
JPG vers PDF : 4 232 octets en moins d'un dixième de seconde.
PNG vers PDF : 2 536 octets en moins d'un dixième de seconde.
WEBP vers PDF : 94 782 octets en moins d'un dixième de seconde.
TIFF vers PDF : 118 721 octets en moins d'un dixième de seconde.
Ce que nous ne prétendrons pas sur HTML vers PDF
Un fichier HTML de plus de 50 Mo est refusé avant la fin de l'envoi plutôt qu'après, pour que vous n'attendiez pas un refus.
Une conversion HTML vers PDF qui dépasse 120 secondes est tuée, et le processus calibre avec elle. Une exécution abandonnée resterait posée sur l'un des deux cœurs de la machine jusqu'à ce que quelqu'un le remarque.
Le fichier HTML qui a servi à prouver cette paire était court. calibre a droit à 120 secondes et un long livre peut réellement les demander toutes : le temps de PDF donné plus bas mesure un petit fichier et ne garantit rien sur le vôtre de mille pages.
Un fichier HTML à la fois, choisi dans le navigateur. Il n'y a rien d'autre à régler et rien d'autre à proposer.
HTML vers PDF : les questions que l'on pose
Qu'est-ce qui convertit vraiment mon fichier HTML en PDF ?
C'est calibre qui s'en charge, par le binaire ebook-convert, sur une machine que nous louons et que nous surveillons. Ni astuce de navigateur, ni service d'un tiers : le fichier HTML est envoyé une fois, calibre s'exécute une fois, le PDF revient, et aucun des deux fichiers n'est conservé ensuite.
Combien de temps prend une conversion HTML vers PDF ?
Sur le fichier utilisé par la sonde, calibre a mis 1,9 seconde et écrit 25 178 octets de PDF. C'est une mesure réelle sur un fichier HTML réel, pas une moyenne et pas une promesse sur le vôtre : un HTML plus gros prend plus longtemps, et au-delà de 120 secondes l'exécution est arrêtée.
Qu'est-ce que je perds en passant du HTML au PDF ?
Celle qu'il faut connaître en premier : vos sauts de page, parce qu'un fichier HTML n'en a jamais eu. calibre redistribue d'abord le texte et calcule les pages du PDF à partir du résultat : la fin d'une page est une décision du moteur et non de l'auteur.
La table des matières survit-elle du HTML au PDF ?
Oui, à condition que votre fichier HTML porte de vrais titres et non du texte qui y ressemble. calibre construit la table des matières du PDF à partir de la structure de titres qu'il trouve, et de grosses lignes en gras mises en forme à la main ne sont pas une structure.
La conversion HTML vers PDF est-elle gratuite ?
Il y a une franchise gratuite chaque mois, et une conversion HTML vers PDF coûte un demi-crédit dessus. Quand la franchise est épuisée, l'outil le dit et s'arrête, plutôt que de vous remettre discrètement un PDF moins bon.