Frage zu nicht funkionierendem RegEx .*

Status
Nicht offen für weitere Antworten.

Don83

Bekanntes Mitglied
Hallo,
ich habe gerade ein Problem. In meiner Freizeit organisiere ich gerade für ein kleines Browserspielchen ein kleines Tunier. Machen an die 500 Leute mit. Ich möchte deshalb die Ergebnisse der Kampfberichte parsen um ein paar Statistiken zu erstellen.

Jetzt will aber aus mir nicht ersichtlichen Gründen das pattern nicht matchen.
Sogar wenn ich .* angebe, was ja quasi sowas wie eine wildcard ist, bekomme ich beim matching ein "false" zurück. Ich kann mir das wirklich nicht erklären.

Weis da jemand vielleicht rat?
Hier meine Klasse und im Anhang die zu parsende File:
[HIGHLIGHT="Java"]import java.io.File;
import java.io.FileNotFoundException;
import java.io.FileReader;
import java.io.IOException;
import java.util.Scanner;
import java.util.regex.Matcher;
import java.util.regex.Pattern;

public class Kampfberichtauswerter {

public static void calcNKAttack(String kb){
Pattern p1 = Pattern.compile(".*");
Matcher m1 = p1.matcher(kb);
System.out.println(m1.matches());

}

public static void main(String[] args) throws IOException {
File datei = new File("kampfbericht.txt");
FileReader leser = new FileReader(datei);

// erzeugen einer Dauerschleife:
StringBuilder input= new StringBuilder();
for (;😉 {
int gelesenInt = leser.read();

// Wenn kein Zeichen mehr zurückgegeben wird (= -1),
// dann ist das Dateienende ereicht,
// daher aufhören
if (gelesenInt == -1) {
break;
}

// ein char wird als integer eingelesen!
// Daher als char umwandeln
char gelesenChar = (char) gelesenInt;

// Jedes Zeichen ausgeben
//System.out.print(gelesenChar);
input.append(gelesenChar);
}
String kampfbericht = input.toString();
System.out.println(kampfbericht);
calcNKAttack(kampfbericht);
}
}[/HIGHLIGHT]
 

Anhänge

Zuletzt bearbeitet von einem Moderator:
Danke 🙂,
ich weis jetzt allerdings noch nicht, wie ich dieses DOTALL aktiviere. 😳 Allerdings lässt es sich auch mit ([\S\s]*) ganz gut umgehen.
 
Ok alles klar danke. Jetzt hätte ich aber noch zwei Fragen 😳.
Und zwar.
Angenommen ich habe solch einen text gegeben:
"(sdfdsfölk("
Hier würde jetzt bemängelt werden, dass die capturing groups nicht geschlossen sind. Aber was wenn die Klammerung teil des zu matchenden Patterns ist?

Und die zweite Frage:
Wenn ich zum Beispiel einen ausdruck habe:
"<a>alkjlklklknlknasdknlk<\a>" Wie kann ich zum Beispiel den inhalt der Tags lesen?
von der logik her irgendwie so: <a>\\S*<\a>
Allerdings will ich ja den Inhalt der tags also schonmal capturing groups, also:
<a>(\\S*)<\a>
Und nachdem ich ja wirklich NUR den inhalt der tags haben will, aber das \\S* eigentlich das hintere tag schlucken würde bräuchte man wohl noch eine kleine modifikation. Ich glaub in perl gab es folgendes Konstrukt: \\S*?
Das wäre die minimale Anzahl an nicht whitespace zeichen bis eben der nächste passende Regex <\a> auftritt. Soetwas bräuchte ich, weis aber leider nicht wies in Java funktioniert. ???:L
 
\\(

und das mit dem ? dürfte funktionieren, siehe 'Reluctant quantifiers' in der Pattern-Beschreibung
 
Ok, also es klappt jetzt so halb. Allerdings habe ich einen Fehler den ich nicht wirklich verstehe :/.
Also hier ist nun mein code:
Code:
import java.io.File;
import java.io.FileNotFoundException;
import java.io.FileReader;
import java.io.IOException;
import java.util.Scanner;
import java.util.regex.Matcher;
import java.util.regex.Pattern;

public class Kampfberichtauswerter {

	public static void calcFKAttack(String kb) {
		// System.out.println(kb);

		// Pattern p1 = Pattern.compile
		Pattern p1 = Pattern
				.compile(
						".+?<td><a\\shref=\"http://cartegon\\.world-of-dungeons\\.de/wod/spiel/hero/profile\\.php\\?id=\\d+?\"\\s+?onClick=\"return\\s+?jump\\('\\S+?',\\d+?\\)\"\\sclass=\"rep_monster\"\\sx=\"\\d+?\">(.+?)</a>\\s+?greift\\sper\\sFernkampf\\san\\s+?\\(<a\\shref=\"http://world-of-dungeons\\.de/skill/\\S+?\"\\sonClick=\"return\\swo\\('/wod/spiel/hero/skill\\S+?'\\)\">\\w+?</a>\\s+?/(\\d+).+?",
						Pattern.DOTALL);
		Matcher m1 = p1.matcher(kb);
		if(m1.matches()){
			//System.out.println("hullu");
			System.out.println(m1.group(1));
			System.out.println(m1.group(2));
		}
		

	}

	public static void main(String[] args) throws IOException {
		File datei = new File("kampfbericht.txt");
		FileReader leser = new FileReader(datei);

		// erzeugen einer Dauerschleife:
		StringBuilder input = new StringBuilder();
		for (;;) {
			int gelesenInt = leser.read();

			// Wenn kein Zeichen mehr zurückgegeben wird (= -1),
			// dann ist das Dateienende ereicht,
			// daher aufhören
			if (gelesenInt == -1) {
				break;
			}

			// ein char wird als integer eingelesen!
			// Daher als char umwandeln
			char gelesenChar = (char) gelesenInt;

			// Jedes Zeichen ausgeben
			// System.out.print(gelesenChar);
			input.append(gelesenChar);
		}
		String kampfbericht = input.toString();
		// System.out.println(kampfbericht);
		calcFKAttack(kampfbericht);
	}
}

Der Bereich den ich parsen und finden will ist dieser hier:

Code:
<td><a href="http://cartegon.world-of-dungeons.de/wod/spiel/hero/profile.php?id=217845" onClick="return jump('h',217845)" class="rep_monster" x="217845">Kyria van Rensing</a>
 greift per Fernkampf an  (<a href="http://world-of-dungeons.de/skill/Doppelschuss&amp;IS_POPUP=1&amp;world=WC" onClick="return wo('/wod/spiel/hero/skill.php?name=Doppelschuss&amp;IS_POPUP=1&amp;world=WC')">Doppelschuss</a>
/201

Dort will ich konkret den Namen, in diesem Fall "Kyria van Rensing" und unten den Wert, also die 201.

Das pattern das ich angegeben habe wird gefunden. Die zweite capturing group funktioniert, also es werden 201 ausgegeben.
Aber bei der ersten capturing group kommt irgendwie noch Salat raus.

Die Ausgabe sieht in etwa wie folgend aus:
Code:
Kyria van Rensing</a>
</td>
<td align="center">33</td>
<td>Rechte Seite</td>
massig Text blabla....
blablablablabla
blablabla
 (<span class="rep_mana_cost">6 MP</span>): Initiative 248</td></tr><tr><td colspan="3"><hr /></td></tr>
<tr><td class="rep_initiative">Initiative 305<br /><span class="rep_action">Aktion 1 von 5</span></td>
<td><a href="http://cartegon.world-of-dungeons.de/wod/spiel/hero/profile.php?id=217845" onClick="return jump('h',217845)" class="rep_monster" x="217845">Kyria van Rensing
Also irgendwie wird das Kyria van Rensing schon erkannt, aber ich bekomme noch so viel Müll mit in die Capturing group und weiß nicht wieso.
Die capturing group in der Regex sieht so aus:
Code:
blabla+?\">(.+?)</a>blabla
also = (.+?)... gefolgt von </a>.
Ich hatte eine Idee, also zum Beispiel die capturing group wie folgend abzuändern:
([[.]&&[^<>]]+?) aber wenn ich dies ändere wird überhaupt kein pattern mehr gefunden.
Allerding weiß ich nicht ob ich das mit den optional Klammern richtig mache, denn es funktioniert noch nicht einmal ([.]+?)
 
ein . in eckigen Klammern ist wirklich nur ein Punkt, viele Sonderzeichen verlieren da ihre Bedeutung,
schreibe
[^<>]+?

warum es ohne nicht geht, kann ich aus dem Kopf nicht sagen,
allgemeiner Tipp: test möglich eng, mit wenig Text,
wenn du auf ein schwer lösbares Problem triffst, beende erstmal komplett dein komisches Programm, vergiss Datei-Einlesen, komischen Methoden wie calcFKAttack() usw

erstelle eine neue Klasse, darin genau eine main-Methode, genau einen Teststring, z.B.
"<a\">Kyria van Rensing</a>"
genau ein Pattern und dann die Auswertung,

wenn das nicht so klappt, wie du es dir vorstellst,
dann kannst du das komplette 20 Zeilen-Programm hier posten und jeder kann es ausprobieren,
wenn es doch klappt, dann langsam erweitern, immer mehr von der Originaldatei kopieren, auch Zeilenumbrüche usw
 
Ah, alles klar! Vielen dank. :toll:
Das der Punkt in eckigen Klammern seine Bedeutung verliert erklärt dann so einiges 🙂.
Ansonsten werd ich mir deinen Tip mal zu Herzen nehmen und wirklich nur den kurzen abschnitt testen.
 
Status
Nicht offen für weitere Antworten.

Zurück
Oben