feat: init plesna-gerance - extracteur de comptes rendus de gerance
- Backend Python (uv + click + FastAPI) - CLI: plesna-gerance extract <pdf> pour extraire les donnees - CLI: plesna-gerance serve pour lancer le serveur API - API REST: POST /api/extract pour upload et extraction de PDF - Parsers modulaires: metadata, locataires, operations - Utilise pdftotext (poppler-utils) pour l'extraction de texte - Frontend Vue.js + Tailwind CSS - Interface split-screen: PDF a gauche, donnees a droite - Preview PDF avec zoom et navigation pages (pdf.js) - Visualisation structuree des donnees extraites - Sections depliables: metadata, locataires, operations - Drag & drop pour upload de PDF - Extraction automatique a la selection du fichier
This commit is contained in:
28
src/plesna_gerance/parsers/pdf.py
Normal file
28
src/plesna_gerance/parsers/pdf.py
Normal file
@@ -0,0 +1,28 @@
|
||||
"""Extraction de texte depuis les PDFs."""
|
||||
|
||||
import subprocess
|
||||
|
||||
|
||||
def extract_text_from_pdf(pdf_path: str) -> str:
|
||||
"""Extrait le texte du PDF via pdftotext.
|
||||
|
||||
Nécessite pdftotext (poppler-utils) installé sur le système:
|
||||
- Ubuntu/Debian: sudo apt-get install poppler-utils
|
||||
- macOS: brew install poppler
|
||||
|
||||
Args:
|
||||
pdf_path: Chemin vers le fichier PDF
|
||||
|
||||
Returns:
|
||||
Texte extrait du PDF avec mise en page préservée
|
||||
|
||||
Raises:
|
||||
subprocess.CalledProcessError: Si pdftotext échoue
|
||||
"""
|
||||
result = subprocess.run(
|
||||
["pdftotext", "-layout", pdf_path, "-"],
|
||||
capture_output=True,
|
||||
text=True,
|
||||
check=True,
|
||||
)
|
||||
return result.stdout
|
||||
Reference in New Issue
Block a user