第3章词法分析与有穷自动机汇编

合集下载

编译原理第三章

例3.4 Z→ A→ B→
有正规文法G： 0A 0A | 0B 1A | ε
例3.5 A→ B→ C→
有正规文法G： aB | bB aC | a | b aB
例3.6 Z→ U→ V→
有正规文法G： Z=0(0|01)*0 U0 | V1 A=(a|b)(aa)*(a|b) Z1 | 1 Z=(10|01)(10|01)* Z0 | 0
A
B
r2 ε
A C
A
B
ε
B
r1
④R为复合正规式？
例3.12 3.13 P41
教学进度
3.4.4 NFA确定化为DFA
方法（子集法） 1、改造M为M’： ①引进新的初态结点X、终态结点Y； ②对M的状态转换图实施分裂（替换）
计算机科学与工程系
2、将M’进一步变换为DFA :
①状态子集T的闭包_CLOSURE(T) ②定义状态集Ta = _CLOSURE(J) ③从DFA的初态_CLOSURE({X})开始计算状态转换矩阵；直到不再产生新的状态子集为止。
第三章
• • • • • •
词法分析与有穷自动机
计算机科学与工程系
词法分析器的功能与输出单词符号的两种定义方式正规表达式与有穷自动机正规文法与有穷自动机词法分析器的设计词法分析程序自动构造工具LEX简介
教学进度
3.1 词法分析器的功能

计算机科学与工程系
词法分析：对字符串表示的源程序进行从左到右的扫描和分解，根据语言的词法规则识别出一个个具有独立意义的单词符号。
教学进度
3.3 单词符号的两种定义方式
单词符号结构的描述方法：
计算机科学与工程系
正规文法（３型文法）(regular grammar)

第三章词法分析和有穷自动机

ε
ε
2
ε
6 b
ε
f
3.4.5 DFA的最小化（化简）
• 最少状态DFA 对于一个DFA M，存在一个最少状态DFA M’，使得L(M’)=L(M)。 (a)没有多余状态 (b)没有两个状态是互相等价的结论：一个NFA 对应的DFA不惟一但它对应的最小化DFA不计同构是惟一的
• 多余状态的例子 a
例
正规式 φ
ε
a a|b ab (a|b)(a|b) a* ba* (a|b)*
正规集 φ {ε } {a} L(a|b)=L(a) ∪ L(b)={a,b} L(ab)=L(a)L(b)={ab} {aa,ab,ba,bb} { ε ,a,aa,aaa,…} {b,ba,baa,baaa,…} {所有由a和b组成的字}
• 例 DFA M=({0,1,2,3},{a,b}, f ,0,{3}) 其中 f 为： f (0,a)=1 f (0,b)=2 f (1,a)=3 f (1,b)=2 f (2,a)=1 f (2,b)=3 f (3,b)=3 f (3,a)=3
3.4.1 确定有穷自动机(DFA) • DFA的表示方法两种：矩阵和图形的方式矩阵称为状态转换矩阵图形称为状态转换图
• NFA M所接受字符串的集合称为NFA M所能识别的语言，记为L(M)。 • NFA的确定化 DFA是NFA的特例
NFA M存在与之等价的DFA M’,L(M)=L(M’) 与某一NFA等价的DFA不惟一正规式 NFA 正规文法 DFA
3.4.4 NFA 确定化
• 状态集合I的空闭包：ε -closure(I) 它是一个状态集合，包含： ♠ I中任何状态q ♠ I中任何状态q经任意条空弧到达的任何状态 • 状态集合I的a弧转换：Ia 定义一个状态集J，J是I中所有状态经一条a 弧到达的状态的全体 Ia＝ε -closure(J)

编译原理第三章_有穷自动机

5
例过河问题分析（续）
初始状态：MWGC-φ；终止状态：φ-MWGC。 g
MWGC-φ
WC-MG
问题：
6
例过河问题状态转换图
起始 g
MWGC-φ g
g φ-MWGC
g
7
WC-MG
m
m MWC-G
w
w
c
C-MWG
c W-MGC
g
g
MGC-W c
MG-WC
w
m
c G-MWC
m
gg MWG-C
+dd. ddd;
输入符号串
数字数字
SB
.
数字
+
A
H
-.
数字
.G
接收：若扫描完输入串，且在一个终止状态上结束。
数字阻塞：若扫描结束但未停止在终止状态上；或者为能扫描完输入串（如遇不合法符号）。
不完全描述：某些状态对于某些输入符号不存在转换。
练习：+34.567 .123 3.4.5
w
有穷自动机（FA）
数字系统：可以从一个状态移动到另一个状态；每次状态转换，都上由当前状态及一组输入符号确定的；可以输出某些离散的值集。
FA：一个状态集合；状态间的转换规则；通过读头来扫描的一个输入符号串。
读头：从左到右扫描符号串。移动（扫描）是由状态转换规则来决定的。
8
读头
一个FA的例子
(3)运行：串f(，Q,且t1tt21)∈= Σf(，f(Qt1,t2t1∈), Σt2*)，其中Q∈K， t1t2为输入字符
17
例３
题：试证abba可为例1的DFA M所识别（所接受）。

sun编译原理第3章词法分析与有穷自动机第4 8讲优质课件

={a,b}*{aa,bb}{a,b}*
练习：若S=a|bb，则L((a|bb)*)=？
2019/11/24
信息学院孙丽云
5
第3章词法分析与有穷自动机
■正规式中运算的优先级
括号优先，* 次之，•（连接）再次之，| 最后例：a|bc* ≌ a|(b(c*))
ab|c*d ≌ (ab)|((c*)d)
其中 U、W∈N t∈T 其中 U、W∈N t∈T
2019/11/24
信息学院孙丽云
8
第3章词法分析与有穷自动机
■正规文法到正规式的转换
(1)将正规文法中的每个非终结符表示成关于它的一个正规式方程，获得一个联立方程组。 (2)依照求解规则:
若x=αx|β(或x=αx+β)，则解为x=α*β; 若x=xα|β(或x=xα+β)，则解为x=βα*; 以及正规式的分配律、交换律和结合律求关于文法开始符号的正规式方程组的解. 这个解是关于该文法开始符号S的一个正规式，显然它表示了由该正规文法所描述的语言。
信息学院孙丽云
2
第3章词法分析与有穷自动机
3.3 语言单词符号的两种定义方式多数程序设计语言的单词符号都能用正规文法或正规式来定义。
■ 正规式与正规集
设有字母表={a1，a2，…，an}，在字母表上的正规式和它所表示的正规集可用如下规则定义：（1） Φ是上的正规式，它所表示的正规集是Φ，即空集{} （2）ε是上的正规式，它所表示的正规集是{ε} （3）ai是上的正规式，它所表示的正规集由单个符号ai组成，即{ai}
③ (e1)*是上的一个正规式，它所表示的正规集为 L((e1)*) =L((e1))*
正规式描述了单词符号的构成规则，正规集是正规式能描述的所有的单词的集合。

编译原理第三章有限自动机与词法分析器

第三章有限自动机与词法分析器3.1词法分析3.1.1词法分析器的功能在第二章里我们已介绍了词法分析的基本问题。

计算机存储是二进制式的，因此，任何一种程序和数据在计算机内部均被表示为二进制表示。

实际上，当程序员每按键盘中的一个键时，自动往计算机里输入一个相应的八位二进制码，称这种码为ASCII码。

当程序员敲完程序时将它保存到自己事先起好名的文件中，因此，程序在计算机文件中的表示是ASCII码序列(末尾有文件结束码)。

编译器总是要用某种程序设计语言来写，而任何一种语言的程序其操作对象必须是该语言所规定的数据。

编译器的操作对象是程序中的各种语法单位，如<常量声明>,<类型声明>,<变量声明>,<过程声明>,<表达式>,<语句>,<变量>等等，因此，必须把它们都表示成某种数据结构形式，而它们的最小单位是所谓的单词，故首当其充的是要把每个单词转换成一种数据形式，通常称它们为TOKEN。

词法分析器的任务就是，从源程序的ASC码(用高级语言的术语来说是字符串)序列逐个地拼出单词，并将构造相应TOKEN数据表示。

词法分析器可有两种，一种是它作为语法分析的一个子程序，一种是它作为编译器的独立一遍。

前一种情形，词法分析器不断地被语法分析器所调用，每调用一次词法分析器将从源程序的字符序列拼出一个单词，并将其TOKEN值返回给语法分析器。

后一种情形则不同，即不是被别的部分不断地调用，而是完成编译器的独立一遍任务，具体说将整个源程序的字符序列转换成TOKEN序列，并将其交给语法/语义分析器。

实际的编译器一般都采用子程序方式，但是为了独立地介绍词法分析、语法分析和语义分析的概念和技术，我们将词法分析部分分离出来即作为独立一遍的词法处理器来介绍。

从实际的角度来说，这种方法有以下缺点:一是因为它要生成TOKEN列，自然多占用空间；二是因为要保存所有的TOKEN，需要耗费更多的时间。

第3章词法分析(3)

编译原理第3章词法分析与有穷自动机(第5-8讲)

它所对应的状态表如图：
状态 0 1 2 3 a 1 3 1 3 后继状态 b 2 2 3 3
输入字符接受否否否是
式的转化
22
第3章词法分析与有穷自动机
■DFA所识别的语言
给定DFA M，对于字符c1,c2,…,cn,当以下条件成立时，称M接受由c1,c2,…,cn组成的字符串c1c2…cn：存在状态序列s0,s1,s2,…,sn,使得s1=f(S,c1), s2=f(s1,c2),…,sn=f(sn-1,cn)，且sn∈Z。由DFA M接受的语言L(M)是所有M接受的字符串组成的集合。
25
第3章词法分析与有穷自动机
判断下图是DFA还是NFA的状态转换图，并写出其他2种表示形式
26
第3章词法分析与有穷自动机
■由正规表达式R构造NFA
1.基本正规表达式 (a)对于正规式φ,所构造NFA: (b)对于正规式ε,所构造NFA: (c)对于正规式a,a∈Σ,则 NFA:
x ε y
练习：若S=a|bb，则L((a|bb)*)=？
5
第3章词法分析与有穷自动机
■正规式中运算的优先级
括号优先，* 次之，•（连接）再次之，| 最后例：a|bc* ≌ a|(b(c*)) ab|c*d ≌ (ab)|((c*)d)
■ 正规式与正规集举例
L(a|bc*)=L(a)∪L(bc*) 思考：L(ab|c*d)=？ =L(a)∪L(b)L(c*) =L(a)∪L(b)(L(c))* ={a}∪{b}{ε,c,cc,ccc……} ={a,b,bc,bcc,bccc,……}
17
第3章词法分析与有穷自动机
■有穷自动机的状态转移图表示方法

第3章词法分析与有穷自动机20090319

单词的种类（1）关键字：if、for、while （2）标识符：（3）常数：（4）运算符：+、-、* （5）分界符：, 、;、(、)
编译原理
2013年8月27日
词法分析程序的输出形式-----二元式
单词类别单词的属性值
单词类别可以用整数编码表示:一类一种或一字一种
单词类别关键字标识符常数运算符分界符
编译原理
2013年8月27日
【例3．9】将描述标识符的正规式R=l(l∣d)*转换成相应的正规文法。
• 令S为文法的开始符号，根据规则（2）有 • S→l(l∣d)* • 根据规则（3）变换为： • S→lA • A→(l∣d)* • 根据规则（4）变换为： • S→lA • A→(l∣d)A∣ε •
有穷自动机的作用
实质上是提供了一种逻辑的探测方式,去探测一些输入串是否属于某种语言,即: 它可以作为一种语法检查器。
编译原理
2013年8月27日
3.4.1
确定的有穷自动机（DFA）
M=(Σ, Q, f,S, Z)
Σ：有穷字母表，它的每个元素称为一个输入符号 Q：有穷状态集，它的每个元素称为一个状态 S∈K，是唯一的初态
运算符的优先级：先*, 后 • , 最后 | • 在正规式中可以省略.
正规式相等这两个正规式表示的语言相等
编译原理
2013年8月27日
正规式举例
• 例：设有字母表 ∑={a,b}，根据正规式与正规集的定义，有以下的正规式和正规集正规式正规集 a {a} a∣b {a,b} ab {ab} ( a∣b)( a∣b) {aa,ab,ba,bb} a* {ε,a,aa,aaa,…,任意个a的串} （a∣b）* {ε，a,b,aa,ab,ba,bb,…所有a,b组成的串} (a︱b) *(aa︱bb) (a︱b) * ∑*上所有含两个连续的a 或两个连续的b组成的串

1、下载文档前请自行甄别文档内容的完整性，平台不提供额外的编辑、内容补充、找答案等附加服务。
2、"仅部分预览"的文档,不可在线预览部分如存在完整性等问题,可反馈申请退款(可完整预览的文档不适用该条件!)。
3、如文档侵犯您的权益，请联系客服反馈,我们会尽快为您处理(人工客服工作时间：9:00-18:30)。

1.词法分析单独作为一遍
第一遍 S.P.(字符串) 词法分析单词串 S.P.(符号串) 第二遍语法分析
2.词法分析程序作为单独的子程序
取单词 S.P.(字符串) 词法分析程序单词
优点: 结构清晰、各遍功能单一缺点：效率低
语法分析程序
编译原理
2018年12月6日3.2词法分析程序的输出形式
所有以a为首的符号串
所有以abb为尾的a，b符号串所有含有两个连续的a或两个连续的b的符号串
(aa|ab|ba|bb) *
(a|b)(a|b)(a|b) *
空串和任何长度为偶数的符号串
任何长度大于等于2的符号串
编译原理
2018年12月6日
【例】使用正规式来表示程序设计语言中的相应单词符号。
<标识符>→字母 | <标识符>字母 | <标识符>数字） <无符号整数>→数字 | <无符号整数>数字 <单界符>→+ | * |< |, | ; <双界符>→<=
编译原理
2018年12月6日
【例】Σ={d,· ,e,+，-} 则Σ上的正规式
d *( · dd*∣ε)(e(+∣- ∣ε)dd*∣ε)表示的是实数。其中d为0～9中的数字。比如：2，12.59,3.6e2和 471.88e-1等等都是该正规集所表示集合中的元素。
【例】设Σ={a,b,c},则aa*bb*cc*是Σ上的一个正规式,
运算符的优先级：先*, 后 • , 最后 | • 在正规式中可以省略.
正规式相等这两个正规式表示的语言相等
编译原理
2018年12月6日
正规式举例
• 例：设有字母表 ∑={a,b}，根据正规式与正规集的定义，有以下的正规式和正规集正规式正规集 a {a} a∣b {a,b} ab {ab} ( a∣b)( a∣b) {aa,ab,ba,bb} a* {ε,a,aa,aaa,…,任意个a的串} （a∣b）* {ε，a,b,aa,ab,ba,bb,…所有a,b组成的串} (a︱b) *(aa︱bb) (a︱b) * ∑*上所有含两个连续的a 或两个连续的b组成的串
第 3章
词法分析
教学目标
1. 本章介绍编译第一个阶段词法分析的设计原理和设计方法，要求明确此阶段的任务。 2. 理解通常的单词分类和构词规则。 3. 会使用单词的描述和识别机制。 4. 要求掌握正规文法、状态图、DFA、NFA、正规式和正规集的基本概念和它们之间的关系。 5. 掌握词法分析程序的手工实现方法。
编译原理
编码
1 2 3 4 5
2018年12月6日
• 单词符号属性的值：
单词自身符号的机内编码。关键字、运算符、界符：只输出其种别码即可。标识符：自身字符串的值，长度受限制。常数：本身的值。字符型输出字符串本身，数值型，输出其自身的二进制。 • 对于标识符和常数，若要建符号表，则输出其在符号表的入口地址。
和L(e2), 那么e1|e2, e1 • e2和e1*也都是上的正规式, 它们所表
示的正规集分别为L(e1)∪L(e2)、 L(e1) • L(e2)和(L(e1))* 4. 任何上的正规式和正规集均由1、2和3产生。
编译原理
2018年12月6日
正规式中的运算符： | -----或（选择） • ----连接 * 或 { } ---重复（） ----括号
单词的种类（1）关键字：if、for、while （2）标识符：（3）常数：（4）运算符：+、-、* （5）分界符：, 、;、(、)
编译原理
2018年12月6日
词法分析程序的输出形式-----二元式
单词类别单词的属性值
单词类别可以用整数编码表示:一类一种或一字一种
单词类别关键字标识符常数运算符分界符
（5）建立符号表。
编译原理
2018年12月6日
main( )/*ADD*/ {int x=10,y=20,sum; sum=x+y; }
词法分析
main、(、)、{、int、x、 =、10、,、y、=、20、,、 sum、;、sum、=、x、+、 y、;、}
编译原理
2018年12月6日
实现方案：基本上有两种
编译原理
2018年12月6日
3.5 3.3.1 正规式与正规集
字母表, 定义在上的正规式和正规集递归定义如下: 1. 和都是上的正规式, 它们所表示的正规集分别为:{}和;
2. 任何a , a是上的正规式,它所表示的正规集为:{a};
3. 假定e1和e2是上的正规式, 它们所表示的正规集分别记为L(e1)
它所表示的正规集 L={abc,aabc,abbc,abcc,aaabc,...}={a mbncl∣m,n,l≥1}
编译原理
2018年12月6日
【例】设Σ={a,b}
正规式 ba* 正规集所有以b为首后跟任意多个a的符号串
a(a|b)*
(a|b)*abb (a|b)*(aa|bb) (a|b)*
标识符：无符号整数：单界符：双界符：
a(a|d) * dd* + | * |< |, | ; <=
编译原理
2018年12月6日
教学内容
1 2 3 4 5 6 词法分析程序的功能词法分析程序的输出形式程序设计语言单词的定义正规式与有穷自动机正规文法与有穷自动机词法分析程序的编写方法
编译原理
2018年12月6日
3.1
词法分析程序的功能
（1）分析和识别单词及属性，
包括识别语言的关键字、标识符、常数、运算符等；（2）跳过各种分隔符，如空格，回车，制表符等；（3）删除注释；（4）进行词法检查，报告所发现的错误；
编译原理
2018年12月6日
表3.1
int x=10,y=20,sum;词法分析的结果
单词的属性值 int 指向x的符号表入口指针 = 10 , 指向y的符号表入口指针 = 20 , 指向sum的符号表入口指针 ;
2018年12月6日
单词类别 1 2 4 3 5 2 4 3 5 2 5
编译原理
3.3语言单词符号的两种定义方式 • 文法定义: 标识符的定义：标识符是以字母开头的、字母数字的组合 . I → aB|a 右线性文法 B →aB| dB| a |d I → a| Ia| Id 左线性文法 • 正规式定义: 字母(字母∣数字)* a(a ∣d)*

第3章词法分析与有穷自动机汇编

编译原理第三章

第三章 词法分析和有穷自动机

编译原理第三章_有穷自动机

sun编译原理第3章词法分析与有穷自动机第4 8讲 优质课件

编译原理 第三章 有限自动机与词法分析器