Este blog ya no está activo, sigue informándote aquí:

Mostrando entradas con la etiqueta Txt. Mostrar todas las entradas
Mostrando entradas con la etiqueta Txt. Mostrar todas las entradas

martes, 25 de noviembre de 2014

PdftoText + Python = Diccionario v2.0

Como os comenté [en el vídeo de ayer] al script, que cree para hacer slipt de palabras de un txt y guardarlas en lineas para crear diccionarios, le faltaban unos cuantos retoques. Por ejemplo, quitar prints absurdos, incluirle un bucle while para poderle pasar txts de una forma mas ágil y/o hacer funciones. 


Así que me he puesto a ello después de hacer todos mi "que haceres" de hoy y la verdad es que estoy contento con el resultado. Sigue siendo un script algo cutre, pero estoy orgulloso.

def abrirguardar(txt):
with open(txt,'r') as f:
for line in f:
for word in line.split():
if word + "\n" in comp:
pass
else:
dic.write(word+"\n")
print "Done"   

while True: 
d1 = raw_input("Dame el archivo: ")
dic = open("dicslipt.txt","a+")
comp =[]
for word in dic:
comp.append(word) 
abrirguardar(d1)  

Descarga: 
Como veis ahora el script es capaz de abrir, leer y crear una lista con cada palabra del archivo dicslipt.txt. La cual, después utilizaremos para general la condición if word + "\n" in comp: para que, en el caso de que sean palabras iguales no las vuelva a escribir. 

Pues, aquí lo tenéis y espero que os sirva mucho.

Sed Buenos ;)  

lunes, 24 de noviembre de 2014

PdftoText + Python = Diccionario

Hoy me he puesto a jugar con Pdf to Text un programa bien junto [a la suit xPDF] capaz de extraer texto de un archivo.pdf y devolverlo en un .txt. Hasta aquí todo bien, ya que es un programa muy fácil de utilizar y da muy buenos resultados. 

El Usage  de pdftotext es bastante sencillo.

Así que, una vez que ya tenia el .txt con el texto que quería, pensé en que seria muy guay poder ordenar por lineas cada una de las palabras y poder hacer un diccionario con ellas. Así que me he puesto a investigar para poder hacerlo en Python. 

Este es el script que ha salido:

d1 = raw_input("Dame el archivo: ")

with open(d1,'r') as f:
    for line in f:
        for word in line.split():
           dic = open("dicslipt.txt","a+")
           dic.write(word + "\n")
           print word
    print "split done"

Si os lo queréis descargar esta en mi GitHub: 
Se puede mejorar de muchas maneras, asi que dejo en vuestras manos los posibles commits y por si no os ha quedado claro el proceso que he utilizado para crear este un diccionario.txt gracias archivos .pdf aquí os dejo el vídeo que he grabado esta tarde. 


Sed Buenos con esto 0;)