Токенизация строки с пробелом в java
Я хочу обозначить строку, как это
String line = "a=b c='123 456' d=777 e='uij yyy'";
Я не могу разделить на основе такой
String [] words = line.split(" ");
любая идея, как я могу разделить, чтобы получить токены, такие как
a=b
c='123 456'
d=777
e='uij yyy';
11 ответов
самый простой способ сделать это вручную, реализация простого конечного автомата. Другими словами, обработайте строку символом за раз:
- когда вы нажмете пробел, отломите токен;
- когда вы нажмете цитату, продолжайте получать символы, пока не нажмете другую цитату.
в зависимости от форматирования исходной строки вы должны иметь возможность использовать регулярное выражение в качестве параметра метода java "split":Кликните здесь для примера.
в Примере не используется регулярное выражение, которое вам понадобится для этой задачи.
вы также можете использовать это так нити в качестве руководства (хотя это в PHP), которое делает что-то очень близкое к тому, что вам нужно. Манипулирование, которое слегка может сделать трюк (хотя наличие кавычек является частью вывода или нет может вызвать некоторые проблемы). Имейте в виду, что regex очень похож на большинство языков.
редактировать: переход слишком далеко в этот тип задачи может опережать возможности регулярного выражения, поэтому вам может потребоваться создать простой парсер.
line.split(" (?=[a-z+]=)")
правильно дает:
a=b
c='123 456'
d=777
e='uij yyy'
убедитесь, что вы адаптируете часть [a-z+] в случае изменения структуры ключей.
редактировать: это решение может потерпеть неудачу, если в части значения пары есть символ"=".
StreamTokenizer может помочь, хотя проще всего настроить разрыв на'=', так как он всегда будет ломаться в начале строки с кавычками:
String s = "Ta=b c='123 456' d=777 e='uij yyy'";
StreamTokenizer st = new StreamTokenizer(new StringReader(s));
st.ordinaryChars('0', '9');
st.wordChars('0', '9');
while (st.nextToken() != StreamTokenizer.TT_EOF) {
switch (st.ttype) {
case StreamTokenizer.TT_NUMBER:
System.out.println(st.nval);
break;
case StreamTokenizer.TT_WORD:
System.out.println(st.sval);
break;
case '=':
System.out.println("=");
break;
default:
System.out.println(st.sval);
}
}
выходы
Ta
=
b
c
=
123 456
d
=
777
e
=
uij yyy
Если вы оставите две строки, которые преобразуют числовые символы в Альфа, то вы получите d=777.0
, что может быть полезно для вас.
предположения:
- ваше имя переменной ('a' в задании 'a=b') может иметь длину 1 или более
- ваше имя переменной ('a 'в задании' a=b') не может содержать пробел, все остальное в порядке.
- проверка вашего ввода не требуется (ввод предполагается в допустимом формате a=b)
Это отлично работает для меня.
вход:
a=b abc='123 456' &=777 #='uij yyy' ABC='slk slk' 123sdkljhSDFjflsakd@*#&=456sldSLKD)#(
выход:
a=b
abc='123 456'
&=777
#='uij yyy'
ABC='slk slk'
123sdkljhSDFjflsakd@*#&=456sldSLKD)#(
код:
import java.util.ArrayList;
import java.util.List;
import java.util.regex.Matcher;
import java.util.regex.Pattern;
public class RegexTest {
// SPACE CHARACTER followed by
// sequence of non-space characters of 1 or more followed by
// first occuring EQUALS CHARACTER
final static String regex = " [^ ]+?=";
// static pattern defined outside so that you don't have to compile it
// for each method call
static final Pattern p = Pattern.compile(regex);
public static List<String> tokenize(String input, Pattern p){
input = input.trim(); // this is important for "last token case"
// see end of method
Matcher m = p.matcher(input);
ArrayList<String> tokens = new ArrayList<String>();
int beginIndex=0;
while(m.find()){
int endIndex = m.start();
tokens.add(input.substring(beginIndex, endIndex));
beginIndex = endIndex+1;
}
// LAST TOKEN CASE
//add last token
tokens.add(input.substring(beginIndex));
return tokens;
}
private static void println(List<String> tokens) {
for(String token:tokens){
System.out.println(token);
}
}
public static void main(String args[]){
String test = "a=b " +
"abc='123 456' " +
"&=777 " +
"#='uij yyy' " +
"ABC='slk slk' " +
"123sdkljhSDFjflsakd@*#&=456sldSLKD)#(";
List<String> tokens = RegexTest.tokenize(test, p);
println(tokens);
}
}
или с регулярным выражением для токенизации и небольшой государственной машиной, которая просто добавляет ключ / val на карту:
String line = "a = b c='123 456' d=777 e = 'uij yyy'";
Map<String,String> keyval = new HashMap<String,String>();
String state = "key";
Matcher m = Pattern.compile("(=|'[^']*?'|[^\s=]+)").matcher(line);
String key = null;
while (m.find()) {
String found = m.group();
if (state.equals("key")) {
if (found.equals("=") || found.startsWith("'"))
{ System.err.println ("ERROR"); }
else { key = found; state = "equals"; }
} else if (state.equals("equals")) {
if (! found.equals("=")) { System.err.println ("ERROR"); }
else { state = "value"; }
} else if (state.equals("value")) {
if (key == null) { System.err.println ("ERROR"); }
else {
if (found.startsWith("'"))
found = found.substring(1,found.length()-1);
keyval.put (key, found);
key = null;
state = "key";
}
}
}
if (! state.equals("key")) { System.err.println ("ERROR"); }
System.out.println ("map: " + keyval);
выводит
map: {d=777, e=uij yyy, c=123 456, a=b}
он выполняет некоторую базовую проверку ошибок и снимает кавычки со значений.
это решение является как общим, так и компактным (это фактически регулярное выражение ответа Клетуса):
String line = "a=b c='123 456' d=777 e='uij yyy'";
Matcher m = Pattern.compile("('[^']*?'|\S)+").matcher(line);
while (m.find()) {
System.out.println(m.group()); // or whatever you want to do
}
другими словами, найдите все прогоны символов, которые являются комбинациями цитируемых строк или символов без пробелов; вложенные кавычки не поддерживаются (нет escape-символа).
public static void main(String[] args) {
String token;
String value="";
HashMap<String, String> attributes = new HashMap<String, String>();
String line = "a=b c='123 456' d=777 e='uij yyy'";
StringTokenizer tokenizer = new StringTokenizer(line," ");
while(tokenizer.hasMoreTokens()){
token = tokenizer.nextToken();
value = token.contains("'") ? value + " " + token : token ;
if(!value.contains("'") || value.endsWith("'")) {
//Split the strings and get variables into hashmap
attributes.put(value.split("=")[0].trim(),value.split("=")[1]);
value ="";
}
}
System.out.println(attributes);
}
выход: {d=777, a=b, e= 'uij yyy', c= '123 456'}
в этом случае непрерывное пространство будет усечено до одного пространства в значении. здесь приписываемый hashmap содержит значения
import java.io.*;
import java.util.Scanner;
public class ScanXan {
public static void main(String[] args) throws IOException {
Scanner s = null;
try {
s = new Scanner(new BufferedReader(new FileReader("<file name>")));
while (s.hasNext()) {
System.out.println(s.next());
<write for output file>
}
} finally {
if (s != null) {
s.close();
}
}
}
}
java.util.StringTokenizer tokenizer = new java.util.StringTokenizer(line, " ");
while (tokenizer.hasMoreTokens()) {
String token = tokenizer.nextToken();
int index = token.indexOf('=');
String key = token.substring(0, index);
String value = token.substring(index + 1);
}