2 Arrays mit komplexen Datentyp vergleichen

MarkusM

Aktives Mitglied
Hallo zusammen!

Ich bin noch ein Neuling in Sachen Javaprogrammierung und brauche mal einen grundsätzlichen Rat wie ich bei einer Problemstellung am besten vorgehe.

Problem:
Ich habe in einer Datenbank zwei vom Aufbau her identische Tabellen, welche mit Datensätzen gefüllt sind. Der Primärschlüssel setzt sich hierbei aus mehreren Feldern zusammen. Nun möchte ich die Datensätze der Tabellen anhand des Primärschlüssels matchen und dann den Inhalt der weiteren Zellen auf Abweichungen untersuchen (Kurz: Primärschlüssel muss logischerweise gleich sein, der Inhalt der weiteren Datenzellen - ca. 100 - soll auf Abweichungen geprüft werden.)

Lösungsansatz a):
Erstellen eines Views, der den Abgleich vornimmt => Arbeit von der Datenbank machen lassen.

Lösungsansatz b):
Einlesen der Tabellendaten in zwei Arrays mit einem komplexen Datentypen, welcher die Tabellenstruktur widerspiegelt. Dann ein Vergleich der beiden Arrays über den Primärschlüssel und abgleich der einzelnen Elemente. => Arbeit wird von Java aus im Speicher erledigt.

Ich hoffe, die Fragestellung kommt einigermaßen verständlich rüber 🙁
Mir ist schon klar, dass hier keine komplette Lösung als antwort kommen kann, es geht mir vielmehr um mögliche Lösungsansätze und wie die erfahrenen Hasen das lösen würden. Für den Ansatz B, der mich unabhängiger von der "Art" der Datenbank macht, habe ich keine Umsetzungsidee - vermute aber mal, dass das eher komplexer wird.

Aufgebaut habe ich das Ganze bisher ohne ein Framework wie Hibernate, da ich zunächst mit dem Grundprinzip klarkommen möchte und zwei Tabellen eigentlich nicht wirklich komplex sind...

Bin für alle Ideen, Anregungen und Vorschläge dankbar!

Viele Grüße

Markus
 
Wie performant soll das Ganze sein? eine Option wäre vllt eine Klasse zu schreiben, die einen Datensatz wiederspiegelt und dort die equals mit der Primärkeylogik überschreiben. Dann die Tabellen in Collections vom Typ dieser Klasse einlesen. Nun kannste das mit contains o.ä. matchen. Das ist aber mit Sicherheit nicht die schnellste Variante.
edit: anders würde ich das - wie du schon selbst gesagt hast - erst mal via SQL joinen. danach kannste ja immernoch auf ne view o.ä. gehen. das ist halt auf jedenfall schneller als das Mapping selbst zu machen..
 
Zuletzt bearbeitet:
Tja, wie performat soll das Ganze sein... Gute Frage.... Aufgrund der mangelnden Erfahrung habe ich null Idee was in der Praxis schneller ist. 😳 Die Anzahl der Datensätze je Tabelle schwank auch zwischen 10 - und 200.000, was die Sache mit der Javalösung sicher noch langsamer macht, oder?

Einfacher ist wahrscheinlich die Datenbankvariante mit dem View. Aufgrund meiner Kenntnisse tendiere ich auch eher in diese Richtung.
 
in java würde man das imho auch nicht selbst mappen. das sollte vorher schon das DMS machen. Was heisst "auf Abweichungen überprüfen"? Das kannst du dann natürlich schon mit Java machen bzw. da kommt dann sql auch irgendwann an seine Grenzen (kommt eben darauf an, wie "tief" dir Prüfung sein soll).
 
Ich mach mal ein Beispiel was ich mit "auf Abweichungen prüfen" meine.

Felder in Tabelle1:

ID1: 1 (Primärschlüssel)
ID2: A (Primärschlüssel)
Saldo: 10,50
Name: Müller, Fritz
... (ca. 100 weitere Felder)

Felder in Tabelle2:
ID1: 1 (Primärschlüssel)
ID2: A (Primärschlüssel)
Saldo: 10,00
Name: Müller, Ferdinand
... (ca. 100 weitere Felder)

Nun möchte ich die beiden Datensätze durch den Primärschlüssel "matchen" und danach die einzelnen Felder inhaltlich auf Übereinstimmung abgleichen. In dem Beispiel würden als 2 Abweichungen auftreten Saldo 10,50<>10,00 (Ausweis: Differenz) und Name Müller, Fritz <> Müller, Ferdinand (Ausweis: false). Natürlich gibt es auch Datensätze die stimmig sind und wahrscheinlich auch welche die nur in Tabelle1 oder in Tabelle2 enthalten sind.

Aber je mehr ich darüber nachdenke, desto eher kommen wohl die Views in Frage.

Wie schaut es eigentlich performancemäßig aus, wenn ich die Daten mit einem SQL-Statement in ein Java RecordSet schaufle und dort den Abgleich durchführe? Gibt das Probleme bei > 100.000 Datensätzen auf nem normalen Desktoprechner? So könnte ich mir theoretisch das Ablegen des Views sparen, oder?
 
das meinte ich mit "das sollte vorher schon das DMS machen".

Du musst nicht unbedingt eine View anlegen. Du kannst die Tabellen via SQL joinen und in ein RecordSet laden. Dann kannste das ganz einfach miteinander vergleichen und das würde auch sehr flott gehen. Beide Tabellen einzeln laden und selbst mappen geht schon auch (s. oben) aber wird wesentlich langsamer sein und auch nicht unbedingt im Sinne des Erfinders...
 
Danke Dir für Deine Hilfestellungen. Ich werde mein Glück mal versuchen! Die Lösung mit dem SQL Join und das Ganze ins Recordset hört sich ganz gut an. :toll:
 
Lösungsansatz b):
Einlesen der Tabellendaten in zwei Arrays mit einem komplexen Datentypen, welcher die Tabellenstruktur widerspiegelt. Dann ein Vergleich der beiden Arrays über den Primärschlüssel und abgleich der einzelnen Elemente. => Arbeit wird von Java aus im Speicher erledigt.

Das hab ich jetzt nicht ganz verstanden. Du hast 2 Tabellen mit identischen PrimaryKeys. Wieso willst du die Tabellen in ein Array laden? Du kannst doch Record fuer Record abarbeiten.

Wieso liest du nicht Tabelle 1 sequentiel durch. Pro Record kannst du dann den entsprechenden Record aus Tabelle 2 rauslesen und die beiden vergleichen!

Diese Loesung beruecksichtigt aber nicht Records, die nur in Tabelle 2 existieren (falls dies der Fall sein sollte).
 
Das war eigentlich mein Gedankengang. Ich bin mir halt nur unsicher, was performanter ist: die von Dir vorgeschlagene Lösung, oder anstelle des sequentiellen Auslesens und Matchens ein neues Recordset mit einem SQLJoin zu erzeugen...

Irgendwie glaube ich die Idee mit dem SQLJoin ist flotter bei >100.000 Datensätzen, oder?
 

Zurück
Oben