Collections Problem bei Überschreibung von hashcode() und equals() bei Hashset-Implementierung

Marinho

Mitglied
Liebe Java-Freunde,

immer wieder habe ich als Gast in dieses Forum geschaut und habe schon vieles lernen können, so dass ich denke, dass jetzt endlich der Zeitpunkt gekommen ist, mich auch zu registrieren. 🙂

Seit vorgestern hänge ich an einer Stelle und scheine mich im Kreis zu drehen. Es geht um ein Hashset, das Objekte der eigenen Klasse Kunde aufnimmt - aber keinerlei Duplikate aufnehmen soll. Ganz wichtig: Ein Duplikat soll nicht nur sein, wenn alle Werte übereinstimmen, sondern auch schon, wenn nur ein Wert doppelt vorkommt.

Der Programmablauf gestaltet sich so bei mir:
Java:
public Set<Kunde> kundenSet = new HashSet<Kunde>();
for (int i = 1; kundenSet.size() < 100; i++) {
	kundenSet.add(new Kunde(500, 5 + i));
}

Die Klasse Kunde enthält neben einem Konstruktur mit 2 int-Parametern folgende Anweisungen bzgl. des Hassets:
Java:
	@Override
	public int hashCode() {
		final int primStart = 31;
		int resultat = 1;
		resultat = primStart * resultat + kundenNr;
		resultat = primStart * resultat + kundenPlz;
		return resultat;
	}

	@Override
	public boolean equals(Object obj) {
		if (this == obj) {
			return false;
		}
		if (obj == null) {
			return false;
		}
		if (getClass() != obj.getClass()) {
			return false;
		}
				
		final Kunde modelKunde = (Kunde)obj;
		
		if (kundenNr != Kunde.kundenNr) {
			return false;
		} else {
			return false;
		}
	}

Was bisher funktioniert: Es werden nur dann doppelte Einträge erkannt, wenn beide int-Parameter bereits mit einem Objekt übereinstimmen. Das macht rein logisch natürlich auch Sinn, weil erst dann ein Objekt gleich zu einem anderen ist. Aber es muss doch auch eine Möglichkeit geben, jeden Parameter einzeln zu betrachten, so dass "gleich" so defininiert wird, dass kein einziger Wert eines jeden Datenfeldes doppelt vorkommt, oder? Im oberen Bsp. (das so natürlich keinen Sinn macht, aber es dient lediglich zum Testen) sollen also auch lauter Duplikate erkannt werden (hier wäre es dann eine Endlosschleife), weil sich der erste int-Parameter (hier 500) beim Schleifendurchlauf ja nicht ändert. Stattdessen werden die Objekte aber munter aufgenommen und nur dann als Duplikate erkannt, wenn sich auch der zweite int-Parameter während des Schleifendurchlaus nicht ändert.

In Kürze: Wie kann ermöglicht werden, dass ein Objekt schon dann als Duplikat gilt, wenn nur einer der int-Parameter bereits vorhanden ist?

Ich habe schon einiges recherchiert und ausprobiert, komme aber einfach nicht auf eine Lösung und freue mich sehr auf eure Antworten. 🙂
 
Deine [c]equals()[/c]-Methode hat mir etwas zu viele [c]return false;[/c] 😉
Wenn du mit dem Hashcode die einzelnen "Stellen" vergleichen willst, könntest du einfach mal versuchen durch [c]primStart[/c] zu teilen.
 
Vielen Dank für deine schnelle Antwort, faetzminator.

Du hast natürlich völlig Recht mit den
Code:
return false;
. Bei diesem Testdurchgang hatte ich den verrückten Gedanke, einfach mal alles auf
Code:
false;
zu setzen - in der Hoffnung, dass es dann auch irgendwann einmal
Code:
false;
ist. 😉 Aber allein schon, dass auch der Returnwert false dem Hashset nicht klar macht, dass die Objekte nicht gleich sind, zeigt doch, dass das Problem irgendwo anders liegt, oder?

Wenn du mit dem Hashcode die einzelnen "Stellen" vergleichen willst, könntest du einfach mal versuchen durch
Code:
primStart
zu teilen.
Dieser Idee kann ich leider nicht ganz folgen. Meinst du damit, dass jeweils durch
Code:
primStart
geteilt wird, anstatt zu multiplizieren oder ist eine ganz eigene Überprüfung in
Code:
hashcode()
zu implementieren?

Folgend noch einmal der "false-korrigierte", aber leider noch immer nicht korrekt funktionierende Quellcode.

Programmablauf
Java:
public Set<Kunde> kundenSet = new HashSet<Kunde>();
		for (int i = 1; kundenSet.size() < 100; i++) {
			kundenSet.add(new Kunde(500, 5 + i));
		}

Klasse Kunde
Java:
	@Override
	public int hashCode() {
		final int primStart = 31;
		int resultat = 1;
		resultat = resultat + kundenNr / primStart;
		resultat = resultat + kundenPlz / primStart;
		return resultat;
	}
	
	@Override
	public boolean equals(Object obj) {
		if (this == obj) {
			return true;
		}
		if (obj == null) {
			return false;
		}
		if (getClass() != obj.getClass()) {
			return false;
		}
				
		final Kunde kunde = (Kunde)obj;
		
		if (kundenNr != kunde.kundenNr) {
			return false;
		}
		if (kundenPlz != kunde.kundenPlz) {
			return false;
		}
			return true;
	}

Über weitere Unterstützung würde ich mich sehr freuen. 🙂
 
Zuletzt bearbeitet:
Ich fürchte du wirst mit deinem Ansatz nicht weit kommen, denn das HashSet vergleicht zwei Objekte nur dann mit equals, wenn ihr HashCode auch gleich ist, und bei zwei Objekten mit zwei unterschiedlichen Parametern wird dies niemal der Fall sein.
Ich würde dir empfehlen, ein TreeSet zu nehmen und einen Comparator zu übergeben.
 
hashCode ist das Hauptproblem,
im Moment ist aber sogar die equals-Methode so restriktiv, dass sie nur bei vollständiger Übereinstimmung true zurückgibt,
das ist eigentlich ganz gut, besser nicht ändern, aber wenn dann wäre die Richtung andersrum
Java:
if (attributA equal other.attributeA) return true; // schon true ohne die anderen Attribute zu kennen

zum HashCode:
wie schon gesagt wurde müsste der HashCode bei allen gleichen übereinstimmen,
bei Object A mit 500 + 5, bei Object B mit 500 + 3 und bei Object C mit 400 + 3,
transitiv wären alle doppelt, brauchen also alle denselben Hashcode,
damit müssten die teils komplett unterschiedlichen Attribute (500 + 5 vs 400 + 3) der Logik nach ignoriert werden,
du könntest nur einen trivialen Hashcode 1 zurückgeben und den Rest der equals-Methode überlassen,
damit wäre das HashSet ohne richtigen Hashcode ungeeignet

wobei es aber, wie mir jetzt bei meinem Beispiel auffällt, in jeder anderen Struktur auch Probleme gibt,
stell dir vor es wird erst A und C eingefügt, die sich in allen unterscheiden, was sollte das Einfügen verhindern?
dann kommt B vorbei und wird sicher abgelehnt, aber A und C bleiben noch drin oder soll nur durch das Auftauchen von B
einer dieser beiden entfernt werden und wenn ja dann A oder C, geht es nach Einfügereihenfolge?
schwierige Sache hast du da..

aber diesen Punkt kannst du ja ignorieren wenn diese Konstellation unwahrscheinlich oder egal ist,

-----

neben Hash- sind auch ordungsbasierte Strukturen wie das genannte TreeSet glaube ich nicht geeignet,
durch die Sortierung verliert man nur mögliche Verknüpfungen,
vorerst rate ich dazu, eine einfache Liste zu verwenden und jedes Element stur mit quadratischen Aufwand mit allen vorherigen zu vergleichen,
ob mit equals() (entspricht dem HashSet mit hashcode() 1 ) oder einer speziellen Methode,
sind es nur wenige Elemente? dann auch schon ausreichend

ob es was effizienteres gibt? hmm,

edit:
sinnvoll wäre wohl eine Richtung, die Attribute herauszulösen und irgendwo zu speichern,
ein Set pro Attribut/ Kategorie
'wenn 500 schon bekannter Wert in Kategorie X ist, dann aktuelles Objekt ignorieren'
 
Zuletzt bearbeitet von einem Moderator:
Euch allen ganz herzlichen Dank für eure Unterstützung.

...bei zwei Objekten mit zwei unterschiedlichen Parametern wird dies niemal der Fall sein.
Stimmt! Das wusste ich, mir war aber noch nie so bewusst, dass sich das natürlich auf alle Parameter bezieht. Den von SlaterB in diesem Zusammenhang angesprochenen trivialen Rückgabewert 1 konnte ich aber auch noch nicht so einsetzen, dass die equals-Methode wie erwartet funktioniert und natürlich wäre fraglich, ob es dann noch ein Hashset sein sollte. Ein TreeSet würde ich aber auch ungern nehmen wollen, um unnötigen Sortierungen zu vermeiden.

ein Set pro Attribut/ Kategorie
wird wohl die Variante sein, wie ich es jetzt umsetze. Allerdíngs bin ich auf der einen Seite erleichert, dass ich nicht nur einen Denkfehler hatte, aber auf der anderen Seite erstaunt, dass so etwas nicht einfach zu implementieren ist. Anfangs habe ich das defintiv unterschätzt. 🙂
 

Neue Themen


Zurück
Oben