Как проверить, является ли строка допустимым идентификатором python? включая проверку ключевых слов?
кто-нибудь знает, есть ли какой-либо встроенный метод python, который проверит, является ли что-то допустимым именем переменной python, включая проверку зарезервированных ключевых слов? (так, то есть, что-то вроде " В " или " для " потерпит неудачу...)
в противном случае, кто-нибудь знает, где я могу получить список зарезервированных ключевых слов (т. е., dyanamically, изнутри python, в отличие от копирования и вставки чего-то из онлайн-документов)? Или, есть другой хороший способ написать свой собственный проверить?
Удивительно, но тестирование путем упаковки setattr в try / except не работает, как-то так:
setattr(myObj, 'My Sweet Name!', 23)
...на самом деле работает! (...и даже можно получить с помощью getattr!)
4 ответов
на keyword
модуль содержит список всех зарезервированных ключевых слов:
>>> import keyword
>>> keyword.iskeyword("in")
True
>>> keyword.kwlist
['and', 'as', 'assert', 'break', 'class', 'continue', 'def', 'del', 'elif', 'else', 'except', 'exec', 'finally', 'for', 'from', 'global', 'if', 'import', 'in', 'is', 'lambda', 'not', 'or', 'pass', 'print', 'raise', 'return', 'try', 'while', 'with', 'yield']
обратите внимание, что этот список будет отличаться в зависимости от того, какая версия Python вы используете, как список ключевых слов (особенно между Python 2 и Python 3).
если вы также хотите все встроенные имена, используйте __builtins__
>>> dir(__builtins__)
['ArithmeticError', 'AssertionError', 'AttributeError', 'BaseException', 'BlockingIOError', 'BrokenPipeError', 'BufferError', 'BytesWarning', 'ChildProcessError', 'ConnectionAbortedError', 'ConnectionError', 'ConnectionRefusedError', 'ConnectionResetError', 'DeprecationWarning', 'EOFError', 'Ellipsis', 'EnvironmentError', 'Exception', 'False', 'FileExistsError', 'FileNotFoundError', 'FloatingPointError', 'FutureWarning', 'GeneratorExit', 'IOError', 'ImportError', 'ImportWarning', 'IndentationError', 'IndexError', 'InterruptedError', 'IsADirectoryError', 'KeyError', 'KeyboardInterrupt', 'LookupError', 'MemoryError', 'NameError', 'None', 'NotADirectoryError', 'NotImplemented', 'NotImplementedError', 'OSError', 'OverflowError', 'PendingDeprecationWarning', 'PermissionError', 'ProcessLookupError', 'ReferenceError', 'ResourceWarning', 'RuntimeError', 'RuntimeWarning', 'StopIteration', 'SyntaxError', 'SyntaxWarning', 'SystemError', 'SystemExit', 'TabError', 'TimeoutError', 'True', 'TypeError', 'UnboundLocalError', 'UnicodeDecodeError', 'UnicodeEncodeError', 'UnicodeError', 'UnicodeTranslateError', 'UnicodeWarning', 'UserWarning', 'ValueError', 'Warning', 'ZeroDivisionError', '_', '__build_class__', '__debug__', '__doc__', '__import__', '__name__', '__package__', 'abs', 'all', 'any', 'ascii', 'bin', 'bool', 'bytearray', 'bytes', 'callable', 'chr', 'classmethod', 'compile', 'complex', 'copyright', 'credits', 'delattr', 'dict', 'dir', 'divmod', 'enumerate', 'eval', 'exec', 'exit', 'filter', 'float', 'format', 'frozenset', 'getattr', 'globals', 'hasattr', 'hash', 'help', 'hex', 'id', 'input', 'int', 'isinstance', 'issubclass', 'iter', 'len', 'license', 'list', 'locals', 'map', 'max', 'memoryview', 'min', 'next', 'object', 'oct', 'open', 'ord', 'pow', 'print', 'property', 'quit', 'range', 'repr', 'reversed', 'round', 'set', 'setattr', 'slice', 'sorted', 'staticmethod', 'str', 'sum', 'super', 'tuple', 'type', 'vars', 'zip']
и обратите внимание, что некоторые из них (например,copyright
) на самом деле не так уж важно, чтобы переопределить.
еще один нюанс: обратите внимание, что в Python 2, True
, False
и None
Не ключевые слова. Однако присвоение None
является SyntaxError. Назначение True
или False
разрешено, хотя и не рекомендуется (то же самое с любым другим встроенным). В Python 3 они являются ключевыми словами, поэтому это не проблема.
Python 3
на Python 3 теперь имеет 'foo'.isidentifier()
, так что это, кажется, лучшее решение для последних версий Python (спасибо fellow runciter@freenode предложение). Однако, несколько вопреки интуиции, он не сверяется со списком ключевых слов, поэтому необходимо использовать комбинацию обоих:
import keyword
def isidentifier(ident: str) -> bool:
"""Determines if string is valid Python identifier."""
if not isinstance(ident, str):
raise TypeError("expected str, but got {!r}".format(type(ident)))
if not ident.isidentifier():
return False
if keyword.iskeyword(ident):
return False
return True
Python 2
для Python 2 Самый простой способ проверить, является ли данная строка допустимым идентификатором Python, - это позволить Python проанализировать ее себя.
есть два возможных подхода. Самый быстрый-использовать ast
, и проверьте, имеет ли AST одного выражения желаемую форму:
import ast
def isidentifier(ident):
"""Determines, if string is valid Python identifier."""
# Smoke test — if it's not string, then it's not identifier, but we don't
# want to just silence exception. It's better to fail fast.
if not isinstance(ident, str):
raise TypeError("expected str, but got {!r}".format(type(ident)))
# Resulting AST of simple identifier is <Module [<Expr <Name "foo">>]>
try:
root = ast.parse(ident)
except SyntaxError:
return False
if not isinstance(root, ast.Module):
return False
if len(root.body) != 1:
return False
if not isinstance(root.body[0], ast.Expr):
return False
if not isinstance(root.body[0].value, ast.Name):
return False
if root.body[0].value.id != ident:
return False
return True
другой-пусть tokenize
модуль разбивает идентификатор на поток токенов и проверяет, что он содержит только наше имя:
import keyword
import tokenize
def isidentifier(ident):
"""Determines if string is valid Python identifier."""
# Smoke test - if it's not string, then it's not identifier, but we don't
# want to just silence exception. It's better to fail fast.
if not isinstance(ident, str):
raise TypeError("expected str, but got {!r}".format(type(ident)))
# Quick test - if string is in keyword list, it's definitely not an ident.
if keyword.iskeyword(ident):
return False
readline = lambda g=(lambda: (yield ident))(): next(g)
tokens = list(tokenize.generate_tokens(readline))
# You should get exactly 2 tokens
if len(tokens) != 2:
return False
# First is NAME, identifier.
if tokens[0][0] != tokenize.NAME:
return False
# Name should span all the string, so there would be no whitespace.
if ident != tokens[0][1]:
return False
# Second is ENDMARKER, ending stream
if tokens[1][0] != tokenize.ENDMARKER:
return False
return True
та же функция, но совместимая с Python 3, выглядит так:
import keyword
import tokenize
def isidentifier_py3(ident):
"""Determines if string is valid Python identifier."""
# Smoke test — if it's not string, then it's not identifier, but we don't
# want to just silence exception. It's better to fail fast.
if not isinstance(ident, str):
raise TypeError("expected str, but got {!r}".format(type(ident)))
# Quick test — if string is in keyword list, it's definitely not an ident.
if keyword.iskeyword(ident):
return False
readline = lambda g=(lambda: (yield ident.encode('utf-8-sig')))(): next(g)
tokens = list(tokenize.tokenize(readline))
# You should get exactly 3 tokens
if len(tokens) != 3:
return False
# If using Python 3, first one is ENCODING, it's always utf-8 because
# we explicitly passed in UTF-8 BOM with ident.
if tokens[0].type != tokenize.ENCODING:
return False
# Second is NAME, identifier.
if tokens[1].type != tokenize.NAME:
return False
# Name should span all the string, so there would be no whitespace.
if ident != tokens[1].string:
return False
# Third is ENDMARKER, ending stream
if tokens[2].type != tokenize.ENDMARKER:
return False
return True
Однако имейте в виду ошибки в Python 3 tokenize
реализация, которая отклоняет некоторые полностью действительные идентификаторы, такие как ℘
, ﮯ
и 贈
. ast
работает отлично. Вообще, я бы не советовал использовать tokenize
на основе проведение фактических проверок.
кроме того, некоторые могут считать тяжелую технику, такую как AST parser, немного излишней. Эта простая реализация является автономной и гарантированно работает на любом Python 2:
import keyword
import string
def isidentifier(ident):
"""Determines if string is valid Python identifier."""
if not isinstance(ident, str):
raise TypeError("expected str, but got {!r}".format(type(ident)))
if not ident:
return False
if keyword.iskeyword(ident):
return False
first = '_' + string.lowercase + string.uppercase
if ident[0] not in first:
return False
other = first + string.digits
for ch in ident[1:]:
if ch not in other:
return False
return True
вот несколько тестов, чтобы проверить все эти работа:
assert(isidentifier('foo'))
assert(isidentifier('foo1_23'))
assert(not isidentifier('pass')) # syntactically correct keyword
assert(not isidentifier('foo ')) # trailing whitespace
assert(not isidentifier(' foo')) # leading whitespace
assert(not isidentifier('1234')) # number
assert(not isidentifier('1234abc')) # number and letters
assert(not isidentifier('')) # Unicode not from allowed range
assert(not isidentifier('')) # empty string
assert(not isidentifier(' ')) # whitespace only
assert(not isidentifier('foo bar')) # several tokens
assert(not isidentifier('no-dashed-names-for-you')) # no such thing in Python
# Unicode identifiers are only allowed in Python 3:
assert(isidentifier('℘')) # Unicode $Other_ID_Start and $Other_ID_Continue
производительность
все измерения были проведены на моей машине (MBPr Mid 2014) на том же случайно сгенерированном наборе тестов 1 500 000 элементов, 1000 000 действительных и 500 000 недействительных. YMMV
== Python 3:
method | calls/sec | faster
---------------------------
token | 48 286 | 1.00x
ast | 175 530 | 3.64x
native | 1 924 680 | 39.86x
== Python 2:
method | calls/sec | faster
---------------------------
token | 83 994 | 1.00x
ast | 208 206 | 2.48x
simple | 1 066 461 | 12.70x
John: в качестве небольшого улучшения я добавил $ в re, иначе тест не обнаружит пробелов:
import keyword
import re
my_var = "$testBadVar"
print re.match("[_A-Za-z][_a-zA-Z0-9]*$",my_var) and not keyword.iskeyword(my_var)
список ключевых слов python короткий, поэтому вы можете просто проверить синтаксис с помощью простого регулярного выражения и членства в относительно небольшом списке ключевых слов
import keyword #thanks asmeurer
import re
my_var = "$testBadVar"
print re.match("[_A-Za-z][_a-zA-Z0-9]*",my_var) and not keyword.iskeyword(my_var)
более короткой, но более опасной альтернативой будет
my_bad_var="%#ASD"
try:exec("{0}=1".format(my_bad_var))
except SyntaxError: #this maynot be right error
print "Invalid variable name!"
и, наконец, немного более безопасный вариант
my_bad_var="%#ASD"
try:
cc = compile("{0}=1".format(my_bad_var),"asd","single")
eval(cc)
print "VALID"
except SyntaxError: #maybe different error
print "INVALID!"