11 GB File lesen ohne zu extrahieren Filedaten Bereich für Bereich adressieren dann mit Multi-Thread id die DB importieren

Raed

Mitglied
Hallo Liebe Leute,
ich bitte euch hier um Hilfe bzw bitte um einen Vorschlag ich habe ein .bz2 File 11 GB groß ich lese das File ohne zu extrahieren mit
Apache commons-compress-1.23.0 es lief alles gut bis ich bestimmte Zeilen vom bz2 File auf Threads verteilen möchte damit ich mit
Multi-Threading der Inhlat des Files in die DB importiere wie ich recherchiert habe (s.Code) man bekommt zum Schluß ein Object vom Type
BufferedReader dort kann man die Methoden ReadLine(); liest man vom File eine Zeile dann bestimmt man die Länge der Zeile (der gelesene String)
summiert man die Länge von z.B 10 Zeilen dann die Summe als Position (Parameter) der Methoden mark(position); liefert dann mit reset(); soll die
Stelle bestimmt werden, wo der Thread anfängt das File zu lesen.

Das Problem:
des Lesen vom .bz2 File läuft ohne Problem aber die Methoden mark(position); und reset() setzen die Position im .bz2 File nicht also wird immer
die erste Ziele gelsen obwohl ich die mark(position); dann reset(); Methoden aufrufe ?

Hat jemand einen Vorschlag gibt es auch andere Metode in Java, mit der kann man das File lesen (ohne zu extrahieren und dann die Stellen im File auf Threads verteilen damit der Inhalt in die DB importiert wird ?

Danke euch 🌹

Apache commons-compress-1.23.0: https://commons.apache.org/proper/commons-compress/download_compress.cgi
Das .zb2 File unter https://enamine.net/compound-collections/real-compounds/real-database (REAL database, HAC 6-21 420M compounds, CXSMILES )

Code:
public static BufferedReader getBufferedReaderForCompressedFile(String filePathWithName) throws FileNotFoundException, CompressorException {
        FileInputStream fin = new FileInputStream(filePathWithName);
        BufferedInputStream bis = new BufferedInputStream(fin);
        CompressorInputStream input = new CompressorStreamFactory().createCompressorInputStream(bis);
        BufferedReader br = new BufferedReader(new InputStreamReader(input));
        String line = "Empty";
        int counter = 0;
        try {
            while ((line = br.readLine()) != null && counter < 10) {
                counter ++;
                line = br.readLine();
                System.out.println(counter+"   "+line+"   row.length     "+line.length());
            }
        } catch (IOException e) {
            e.printStackTrace();
        }
        return br;
    }
 
des Lesen vom .bz2 File läuft ohne Problem aber die Methoden mark(position); und reset() setzen die Position im .bz2 File nicht also wird immer
die erste Ziele gelsen obwohl ich die mark(position); dann reset(); Methoden aufrufe ?
Hast Du denn mal geprüft, ob mark überhaupt unterstützt wird?

InputStream (Java Platform SE 8 ) (oracle.com)

Evtl. nutzt du mark / reset obwohl es nicht unterstützt wird vom verwendeten Stream.

Aber ich habe auch nicht genau verstanden, was Du versuchst. Nutzt Du mark / reset auf mehreren Threads oder Readern? Das klingt auch schon etwas dubios.

Ich würde mit nur einem Thread die Datei lesen und die gelesenen Datensätze können dann auf mehreren Thread aufgeteilt verarbeitet werden.
Aber wenn es um einen Datenbank Import geht, dann ist hier auch die Frage, was das für eine Datenbank genau ist. Viele Datenbanken bieten Bulk Import Funktionen und wenn es um den Import von vielen Daten geht, dann ist das ggf. ein deutlich besserer Weg, Das müsste man sich aber im Detail ansehen.

11GB hört sich erst einmal noch unkritisch an, aber bei großen Datenmengen macht es ggf. auch Sinn, sich zu überlegen, wie man das optimieren kann. Man kann da einiges machen wie Prüfungen vor dem Import deaktivieren, Daten ungeprüft einfügen und dann im Nachgang die Prüfungen durchführen lassen / wieder zu aktivieren. Aber da ist halt die Frage, ob sowas interessant wird. Da geht es halt um Fragen wie:
  • Was für Datenmengen liegen vor bzw. um was für Zeiten geht es beim regulären import?
  • Ist die Datenqualität ok?
  • Was sind die zeitlichen Vorgaben? Was muss eingehalten werden?
  • Geht es um einen ersten Import oder gibt es bereits Daten?
  • ...

Das ist halt ein umfangreiches Thema nur eben sind die Vorgaben / das eigentliche Problem für uns unbekannt. Daher nur der allgemeine Hinweis.
 
Hallo Konrad,

ich danke dir für dein Feedback habe die Methode boolean markSupported(); auf BufferedReader aufgerufen das Ergebnis war true aber
denke Apache API wird mit Java Lib. vielleicht Streß verursachen daher geht nicht bin mir aber nicht sicher ?

Habe auch überlegt ob ein Thread liest und neue Threads für Import in die DB startet ob eine bessere Möglichkeit/Idee gibt daher frage ich.

Informiere mich über Bulk Import danke für den Vorschlag.

ich habe mariaDB dazu es sind 12 .bz2 Files ich teste nur mit einem erst, man soll die CPU's optimal beschäftigen ca. 20 bzw mehr.
Man kann aber optimieren bis man die beste Leistung durch Messung/Testen bekommt.

Die Datenqualität ist OK die Daten sind sauber später kann man auch noch prüfen bzw Algorithmus für die Prüfung entwickeln da ich momentan
beim zerlegen eines .bz2 File beschäftigt bin, alles anderse kommt in Zukunft bzw später. Es geht um ersten Import.

Ich danke dir ganz herzlich Lieber Konrad falls du Kommentar hast immer wilkommen.

Grüße,

Raed
 
Für alle die gleiche Frage haben ich habe bei Chatgpt mich schlauer gemacht und die folgende Frage gestellt :

ich möchte auf .bz2 Datei die Zeilen bestimmen, die ich lesen möchte dann die Zeilen auf Threads verteilen geht das ohne bz2 auszupacken ?

Die Antwort war :
Es tut mir leid, aber das ist nicht möglich, ohne die BZ2-Datei zu entpacken.
BZ2-Dateien sind im Blockformat komprimiert, was bedeutet, dass sie in zusammenhängende Blöcke aufgeteilt sind. Jeder Block hängt von den vorherigen Blöcken ab, um korrekt dekomprimiert zu werden. Daher ist ein sequenzieller Zugriff erforderlich, um die Daten zu lesen.
Um auf bestimmte Zeilen in einer BZ2-Datei zuzugreifen und sie auf Threads zu verteilen, müssten Sie die Datei entpacken, um die Zeilen korrekt zu lesen und aufzuteilen. Andernfalls besteht keine Möglichkeit, den Inhalt der Zeilen genau zu bestimmen und sie auf Threads zu verteilen, ohne die BZ2-Komprimierung zu berücksichtigen.
 

Zurück
Oben