Class PdfExtractor

Information

Représente le composant Documentize.PdfExtractor. Utilisé pour extraire du texte, des images, des données de formulaire, des propriétés (Métadonnées) des documents PDF.

public static class PdfExtractor

Héritage

object
PdfExtractor

Membres hérités

Méthodes

Extract(ExtractTextOptions)

Extrait le texte d’un document PDF.

public static string Extract(ExtractTextOptions options)

Paramètres

  • options ExtractTextOptions : Un objet d’options contenant les instructions pour l’opération.

Retour

string : Texte extrait.

Exemples

L’exemple montre comment extraire le contenu texte d’un fichier PDF.

// Créez l’objet ExtractTextOptions pour définir le chemin du fichier d’entrée
var options = new ExtractTextOptions("path_to_your_pdf_file.pdf");
// Effectuez le processus et récupérez le texte extrait
var textExtracted = PdfExtractor.Extract(options);

L’exemple montre comment extraire le contenu texte d’un flux PDF.

// Créez l’objet ExtractTextOptions pour définir le flux d’entrée
var stream = File.OpenRead("path_to_your_pdf_file.pdf");
var options = new ExtractTextOptions(stream);
// Effectuez le processus et récupérez le texte extrait
var textExtracted = PdfExtractor.Extract(options);

L’exemple montre comment extraire le texte d’un document PDF en spécifiant le TextFormattingMode.

// Créez l’objet ExtractTextOptions pour définir le chemin du fichier et le TextFormattingMode
var options = new ExtractTextOptions("path_to_your_pdf_file.pdf", TextFormattingMode.Pure);
// Effectuez le processus et récupérez le texte extrait
var textExtracted = PdfExtractor.Extract(options);

L’exemple montre comment extraire le texte d’un fichier PDF de la manière la plus concise possible.

// Effectuez le processus et récupérez le texte extrait
var textExtracted = PdfExtractor.Extract(new ExtractTextOptions("path_to_your_pdf_file.pdf", TextFormattingMode.Pure));

Exceptions

ArgumentException
Si les options ne sont pas définies.

Extract(ExtractImagesOptions)

Extrait les images d’un document PDF.

public static ResultContainer Extract(ExtractImagesOptions options)

Paramètres

  • options ExtractImagesOptions : Un objet d’options contenant les instructions pour l’opération.

Retour

ResultContainer : Un objet contenant le résultat de l’opération.

Exemples

L’exemple montre comment extraire des images d’un document PDF.

// Créez l’objet ExtractImagesOptions pour définir les instructions
var options = new ExtractImagesOptions();
// Ajoutez le chemin du fichier d’entrée
options.AddInput(new FileData("path_to_your_pdf_file.pdf"));
// Définissez le chemin du répertoire de sortie
options.AddOutput(new DirectoryData("path_to_results_directory"));
// Effectuez le processus
var results = PdfExtractor.Extract(options);
// Récupérez le chemin de l’image résultante
var imageExtracted = results.ResultCollection[0].ToFile();

L’exemple montre comment extraire des images d’un document PDF vers des flux sans créer de dossier.

// Créez l’objet ExtractImagesOptions pour définir les instructions
var options = new ExtractImagesOptions();
// Ajoutez le chemin du fichier d’entrée
options.AddInput(new FileData("path_to_your_pdf_file.pdf"));
// Aucun résultat de sortie défini – les résultats seront écrits dans des flux
// Effectuez le processus
var results = PdfExtractor.Extract(options);
// Récupérez le flux
var ms = results.ResultCollection[0].ToStream();
// Copiez les données dans un fichier à des fins de démonstration
ms.Seek(0, SeekOrigin.Begin);
using (var fs = File.Create("test_file.png"))
{
    ms.CopyTo(fs);
}

Exceptions

ArgumentException
Si les options ne sont pas définies.

Extract(ExtractFormDataToDsvOptions)

Extrait les données de formulaire d’un document PDF.

public static ResultContainer Extract(ExtractFormDataToDsvOptions options)

Paramètres

Retour

ResultContainer : Un objet contenant le résultat de l’opération.

Exemples

L’exemple montre comment exporter les valeurs du formulaire vers un fichier CSV.

// Créez l’objet ExtractFormDataToDsvOptions pour définir les instructions
var options = new ExtractFormDataToDsvOptions(',', true);
// Ajoutez le chemin du fichier d’entrée
options.AddInput(new FileData("path_to_your_pdf_file.pdf"));
// Définissez le chemin du fichier de sortie
options.AddOutput(new FileData("path_to_result_csv_file.csv"));
// Effectuez le processus
PdfExtractor.Extract(options);

L’exemple montre comment exporter les valeurs du formulaire vers un fichier TSV et définir des propriétés.

// Créez l’objet ExtractFormDataToDsvOptions pour définir les instructions
var options = new ExtractFormDataToDsvOptions();
//Définir le délimiteur
options.Delimiter = '\t';
//Ajouter les noms de champ au résultat
options.AddFieldName = true;
// Ajoutez le chemin du fichier d’entrée
options.AddInput(new FileData("path_to_your_pdf_file.pdf"));
// Définissez le chemin du fichier de sortie
options.AddOutput(new FileData("path_to_result_csv_file.tsv"));
// Effectuez le processus
PdfExtractor.Extract(options);

Exceptions

ArgumentException
Si les options ne sont pas définies.

Extract(ExtractPropertiesOptions)

Extrait les propriétés d’un document PDF.

public static PdfProperties Extract(ExtractPropertiesOptions options)

Paramètres

Retour

PdfProperties : Un objet contenant le résultat de l’opération.

Exemples

L’exemple montre comment extraire les propriétés (Nom du fichier, Titre, Auteur, Sujet, Mots‑clés, Date de création, Date de modification, Application, Producteur PDF, Nombre de pages) d’un fichier PDF.

// Créez l’objet ExtractPropertiesOptions pour définir le fichier d’entrée
var options = new ExtractPropertiesOptions("path_to_your_pdf_file.pdf");
// Effectuez le processus et récupérez les propriétés
var pdfProperties = PdfExtractor.Extract(options);
var filename = pdfProperties.FileName;
var title = pdfProperties.Title;
var author = pdfProperties.Author;
var subject = pdfProperties.Subject;
var keywords = pdfProperties.Keywords;
var created = pdfProperties.Created;
var modified = pdfProperties.Modified;
var application = pdfProperties.Application;
var pdfProducer = pdfProperties.PdfProducer;
var numberOfPages = pdfProperties.NumberOfPages;

L’exemple montre comment extraire les propriétés (Titre, Auteur, Sujet, Mots‑clés, Date de création, Date de modification, Application, Producteur PDF, Nombre de pages) d’un flux PDF.

// Créez l’objet ExtractPropertiesOptions pour définir le flux d’entrée
var stream = File.OpenRead("path_to_your_pdf_file.pdf");
var options = new ExtractPropertiesOptions(stream);
// Effectuez le processus et récupérez les propriétés
var pdfProperties = PdfExtractor.Extract(options);
var title = pdfProperties.Title;
var author = pdfProperties.Author;
var subject = pdfProperties.Subject;
var keywords = pdfProperties.Keywords;
var created = pdfProperties.Created;
var modified = pdfProperties.Modified;
var application = pdfProperties.Application;
var pdfProducer = pdfProperties.PdfProducer;
var numberOfPages = pdfProperties.NumberOfPages;

L’exemple montre comment extraire les propriétés d’un fichier PDF de la manière la plus concise possible.

// Effectuez le processus et récupérez les propriétés
var pdfProperties = PdfExtractor.Extract(new ExtractPropertiesOptions("path_to_your_pdf_file.pdf"));

Exceptions

ArgumentException
Si les options ne sont pas définies.

Espace de noms : Documentize
Assemblage : Documentize.dll

 Français