Tworzymy domową bibliotekę z Notion i Python

Zawsze byłem ciekaw, jak lepiej zorganizować książki w mojej elektronicznej bibliotece. Ostatecznie doszedłem do rozwiązania z automatycznym liczeniem stron i innymi przydatnymi funkcjami. Wszystkie zainteresowane osoby zapraszam pod kat.

Część 1. Dropbox

Wszystkie książki mam na Dropboxie. Podzieliłem je na 4 kategorie: Podręcznik, Słownik, Liryka, Nieliryka. Jednak nie dodaję słowników do tabeli.

Większość książek to pliki .epub, pozostałe to .pdf. Oznacza to, że końcowe rozwiązanie musi obejmować oba formaty.

Ścieżki do książek wyglądają mniej więcej tak:

/Книги/Нехудожественное/Новое/Дизайн/Юрий Гордон/Книга про буквы от А до Я.epub 

Jeśli książka jest literacka, kategoria (czyli „Design” w powyższym przypadku) jest pomijana.

Postanowiłem nie bawić się w API Dropboxa, dobrze, że mam zainstalowaną aplikację, która synchronizuje folder. Plan jest taki: bierzemy książki z folderu, każdą książkę przepuszczamy przez licznik słów, dodajemy do Notion.

Część 2. Dodajemy wiersz

Tabela powinna wyglądać mniej więcej tak. UWAGA: nazwy kolumn lepiej pisać łacińskimi literami.

Tworzymy domową bibliotekę z Notion i Python

Użyjemy nieoficjalnego API Notion, ponieważ oficjalne jeszcze nie zostało wprowadzone.

Tworzymy domową bibliotekę z Notion i Python

Wchodzimy do Notion, naciskamy Ctrl + Shift + J, przechodzimy do Application -> Cookies, kopiujemy token_v2 i nazywamy go TOKEN. Potem idziemy na potrzebną nam stronę z tabelką biblioteki i kopiujemy link. Nazywamy NOTION.

Następnie piszemy kod do połączenia z Notion.

database = client.get_collection_view(NOTION)
current_rows = database.default_query().execute()

Potem napiszmy funkcję do dodawania wiersza do tabeli.

def add_row(path, file, words_count, pages_count, hours):
    row = database.collection.add_row()
    row.title = file

    tags = path.split("/")

    if len(tags) >= 1:
        row.what = tags[0]

    if len(tags) >= 2:
        row.state = tags[1]

    if len(tags) >= 3:
        if tags[0] == "Literatura":
            row.author = tags[2]

        elif tags[0] == "Nieliteratura":
            row.tags = tags[2]

        elif tags[0] == "Podręczniki":
            row.tags = tags[2]

    if len(tags) >= 4:
        row.author = tags[3]

    row.hours = hours
    row.pages = pages_count
    row.words = words_count

Co się tutaj dzieje. Bierzemy i dodajemy nowy wiersz do tabeli jako pierwszy wiersz. Następnie dzielimy naszą ścieżkę po „/” i uzyskujemy tagi. Tagi – w sensie „Literatura”, „Design”, kto jest autorem itd. Potem wypełniamy wszystkie wymagane pola tabeli.

Część 3. Liczymy słowa, godziny i inne przyjemności

To już nieco bardziej skomplikowane zadanie. Jak pamiętamy, mamy dwa formaty: epub i pdf. Jeśli z epub wszystko jest jasne — słowa tam prawdopodobnie na pewno są, to w przypadku pdf nie jest to takie jednoznaczne: może on składać się po prostu z połączonych obrazów.

Zatem funkcja do zliczania słów w pdf będzie wyglądać następująco: bierzemy liczbę stron i mnożymy przez określoną stałą (średnia liczba słów na stronę).

Oto ona:

def get_words_count(pages_number):
    return pages_number * WORDS_PER_PAGE

To średnia WORDS_PER_PAGE dla strony A4 wynosi około 300.

Teraz napiszmy funkcję do zliczania stron. Użyjemy PyPDF2.

def get_pdf_pages_number(path, filename):
    pdf = PdfFileReader(open(os.path.join(path, filename), 'rb'))
    return pdf.getNumPages()

Następnie napiszemy coś do zliczania stron w epub. Użyjemy epub_converter. Tutaj bierzemy książkę, konwertujemy ją na linijki, a następnie dla każdej linijki zliczamy słowa.

def get_epub_pages_number(path, filename):
    book = open_book(os.path.join(path, filename))
    lines = convert_epub_to_lines(book)
    words_count = 0

    for line in lines:
        words_count += len(line.split(" "))

    return round(words_count / WORDS_PER_PAGE)

Teraz obliczymy czas. Bierzemy naszą ulubioną liczbę słów i dzielimy przez twoją prędkość czytania.

def get_reading_time(words_count):
    return round(((words_count / WORDS_PER_MINUTE) / 60) * 10) / 10

Część 4. Łączymy wszystkie części

Musimy przejść przez wszystkie możliwe ścieżki w naszym folderze z książkami. Sprawdzić, czy książka już istnieje w Notion: jeśli tak, to nie musimy tworzyć nowego wpisu.
Następnie musimy określić typ pliku, w zależności od tego zliczyć liczbę słów. Na koniec dodać książkę.

Oto jaki kod otrzymujemy:

for root, subdirs, files in os.walk(BOOKS_DIR):
    if len(files) > 0 and check_for_excusion(root):
        for file in files:
            array = file.split(".")
            filetype = file.split(".")[len(array) - 1]
            filename = file.replace("." + filetype, "")
            local_root = root.replace(BOOKS_DIR, "")

            print("Dir: {}, file: {}".format(local_root, file))

            if not check_for_existence(filename):
                print("Dir: {}, file: {}".format(local_root, file))

                if filetype == "pdf":
                    count = get_pdf_pages_number(root, file)

                else:
                    count = get_epub_pages_number(root, file)

                words_count = get_words_count(count)
                hours = get_reading_time(words_count)
                print("Pages: {}, Words: {}, Hours: {}".format(count, words_count, hours))
                add_row(local_root, filename, words_count, count, hours)

A funkcja do sprawdzania, czy książka została dodana, wygląda tak:

def check_for_existence(filename):
    for row in current_rows:
        if row.title in filename:
            return True

        elif filename in row.title:
            return True

    return False

Podsumowanie

Dziękuję wszystkim, którzy przeczytali ten artykuł. Mam nadzieję, że pomoże Wam czytać więcej 🙂

Źródło: habr.com

Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS 🔥 Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS | ProHoster