Винаги ме е интересувало как да подредя книгите в електронната си библиотека по-добре. Накрая стигнах до вариант с автоматично преброяване на страниците и други удобства. Всички заинтересовани, моля, под кат.
Част 1. Dropbox
Всичките ми книги са в дропбокса. Четирите категории, на които съм ги разделил, са: Учебник, Справочник, Художествена литература, Нехудожествена литература. Справочниците обаче не ги добавям в таблицата.
По-голямата част от книгите са .epub, а останалите са .pdf. Тоест, крайната версия трябва да покрива и двата варианта.
Пътищата до книгите са ми приблизително такива:
/Книги/Нехудожественное/Новое/Дизайн/Юрий Гордон/Книга про буквы от А до Я.epub Ако книгата е художествена, категорията (тоест „Дизайн“ в случая по-горе) отпада.
Реших да не се занимавам с API на дропбокса, тъй като имам приложението им, което синхронизира папката. Тоест, планът е такъв: взимаме книгите от папката, всяка книга минава през брояча на думи и я добавяме в Notion.
Част 2. Добавяме ред
Самата таблица трябва да изглежда приблизително така. ВНИМАНИЕ: имената на колоните е по-добре да са на латиница.

Ще използваме неофициалното API на Notion, тъй като официалното все още не е налично.

Отиваме в Notion, натискаме Ctrl + Shift + J, отиваме в Application -> Cookies, копираме token_v2 и го наричаме TOKEN. След това отиваме на необходимата ни страница с таблицата на библиотеката и копираме линка. Наравяме го NOTION.
След това пишем код за свързване с Notion.
database = client.get_collection_view(NOTION)
current_rows = database.default_query().execute()След това ще напишем функция за добавяне на ред в таблицата.
def add_row(path, file, words_count, pages_count, hours):
row = database.collection.add_row()
row.title = file
tags = path.split("/")
if len(tags) >= 1:
row.what = tags[0]
if len(tags) >= 2:
row.state = tags[1]
if len(tags) >= 3:
if tags[0] == "Художествена литература":
row.author = tags[2]
elif tags[0] == "Нехудожествена литература":
row.tags = tags[2]
elif tags[0] == "Учебници":
row.tags = tags[2]
if len(tags) >= 4:
row.author = tags[3]
row.hours = hours
row.pages = pages_count
row.words = words_countКакво се случва тук. Взимаме и добавяме нов ред в таблицата на първия ред. След това разделяме пътя си по „/“ и получаваме тагове. Таговете са в контекста на „Художествена литература“, „Дизайн“, кой е авторът и така нататък. След това задаваме всички необходими полета на таблицата.
Част 3. Преброяваме думи, часове и други удобства
Това е малко по-сложна задача. Както знаем, имаме два формата: epub и pdf. Ако с epub всичко е ясно — вероятно там думите наистина присъстват, то за pdf не е толкова просто: той може да се състои единствено от слепени изображения.
Така че функцията за преброяване на думи в pdf ще изглежда по следния начин: вземаме броя на страниците и го умножаваме по определена константа (среден брой думи на страница).
Ето я:
def get_words_count(pages_number):
return pages_number * WORDS_PER_PAGEТази WORDS_PER_PAGE за A4 страница е приблизително 300.
Сега да напишем функция за преброяване на страниците. Ще използваме .
def get_pdf_pages_number(path, filename):
pdf = PdfFileReader(open(os.path.join(path, filename), 'rb'))
return pdf.getNumPages()След това ще напишем нещо за преброяване на страниците в epub. Ще използваме . Тук вземаме книгата, конвертираме я в редове и за всеки ред преброяваме думите.
def get_epub_pages_number(path, filename):
book = open_book(os.path.join(path, filename))
lines = convert_epub_to_lines(book)
words_count = 0
for line in lines:
words_count += len(line.split(" "))
return round(words_count / WORDS_PER_PAGE)Сега ще направим преброяване на времето. Вземаме любимото ни количество думи и го делим на вашата скорост на четене.
def get_reading_time(words_count):
return round(((words_count / WORDS_PER_MINUTE) / 60) * 10) / 10Част 4. Свързваме всички части
Трябва да обходим всичките възможни пътища в нашата папка с книги. Проверяваме дали книгата вече е в Notion: ако е така — не е необходимо да създаваме ред.
След това трябва да определим типа на файла, в зависимост от което да преброим броя на думите. Накрая добавяме книгата.
Ето какъв код получаваме:
for root, subdirs, files in os.walk(BOOKS_DIR):
if len(files) > 0 and check_for_excusion(root):
for file in files:
array = file.split(".")
filetype = file.split(".")[len(array) - 1]
filename = file.replace("." + filetype, "")
local_root = root.replace(BOOKS_DIR, "")
print("Dir: {}, file: {}".format(local_root, file))
if not check_for_existence(filename):
print("Dir: {}, file: {}".format(local_root, file))
if filetype == "pdf":
count = get_pdf_pages_number(root, file)
else:
count = get_epub_pages_number(root, file)
words_count = get_words_count(count)
hours = get_reading_time(words_count)
print("Pages: {}, Words: {}, Hours: {}".format(count, words_count, hours))
add_row(local_root, filename, words_count, count, hours)А функцията за проверка дали книгата е добавена изглежда така:
def check_for_existence(filename):
for row in current_rows:
if row.title in filename:
return True
elif filename in row.title:
return True
return FalseЗаключение
Благодаря на всички, които прочетоха тази статия. Надявам се, че ще ви помогне да четете повече 🙂
Източник: habr.com
