Todo jornalista que já conseguiu documentos exclusivos sabe: quanto mais difícil de ler for um arquivo PDF, mais relevante é a pauta contida dentro dele. O lado bom é que cada vez mais ferramentas conseguem te ajudar a acessar as informações sem ter que redigitar tudo manualmente.
Nessa sessão, Jonathan Soma vai te apresentar a Natural PDF, sua biblioteca em Python feita para fazer a máquina ler os PDFs mais problemáticos, inclusive detectando tabelas e usando inteligência artificial para extrair dados e reconhecer citações.
Portanto, traga os seus PDFs mais horrorosos para testar o poder da tecnologia em prol da transparência.
Requisitos: ter conhecimentos básicos de Python e pelo menos um arquivo PDF horrível.
Material a ser usado na oficina: https://jsoma.github.io/natural-pdf-workshop/
Oficina com tradução simultânea.