从临床试验实例看优效、等效和非劣效试验
从临床试验实例看优效、等效和非劣效试验 - 结合一些临床试验的例子对优效、等效和非劣效试验再做一点阐述,权当加深理解吧。 让我们先看一个简单的例子(J Am Acad Dermatol 2003;48:535-41): 为了证实地氯雷他定对慢性荨麻疹的疗效和安全性,研究者设计了一项地氯雷他定对比安慰剂治疗慢性荨麻疹的随机对照双盲试验。本试验选择的主要终点是与基线相比搔痒评分的变化。假设标准差为1.0分,每组需要100例病人在0.05的显著性水平上有90%的把握能检验出两组0.5分或更多的差别。最后结果地氯雷他定与基线相比搔痒评分的变化为1.05,安慰剂组为0.52,p<0.001. 结论地氯雷他定可以有效治疗慢性荨麻疹。 以上这个例子就是一个最经典的优效性试验的例子,即通过安慰剂对照试验显示试验药物优于安慰剂,从而证实试验药物的疗效。这种安慰对照的优效性试验在临床试验的发展进程中起到了鼻祖的作用,以前对于某种疾病还没有治疗药物的时候,一种新药物的出现,往往会选择安慰剂对照来证实疗效,当然随着越来越多标准药物的出现,以及出于伦理等方面的考虑,现在安慰剂对照的试验也开始变少,但它在药物研发中的地位是决不能抹杀的。 随着医学的发展,现在各个疾病基本上都有自己有效的治疗药物,这时我们推出一种新药,往往在选择对照时,不得不选择那些已有的有效治疗药物,所以相比较安慰剂对照试验,阳性对照试验越来越多,而阳性对照试验最理想的情况是,你的药物优于阳性对照药物,这和上文中提及的安慰剂对照试验一样,是证实你的药物的疗效的最好的也是最有力的方法。这种阳性对照的优效性试验在现在我们的临床试验中发挥了很重要的作用,怎么说呢,一种新药的出现,如果它有突破性的进展,最大的证明就是你的疗效优于现在这种疾病的标准治疗药物,而此时阳性对照的优效性试验就是你证明你疗效的最理想的选择。 给大家介绍一个药物研发历史上一个很著名的阳性对照优效性试验的例子-EVIDENCE研究。 2003年3月8日,美国FDA正式批准瑞士雪兰诺公司的Rebif(干扰素beta-1a)治疗复发性多发性硬化。此次FDA批准Rebif上市,打破了另外一种干扰素类药物Avonex的市场专有状态,Avonex在1996年被批准用于多发性硬化的治疗。那么FDA为什么批准呢,其中最重要的依据就是一项Rebif与Avonex直接比较的研究-EVIDENCE研究,而Rebif的批准则说明了如果有另外一种药物比原有药物更有效或者更安全的话,那么就可以打破原有药物的市场专有状态。 那么现在我们来看一下EVIDENCE的研究设计和结果吧。 EVIDENCE研究是一项比较Rebif与Avonex两种药物治疗复发性多发性硬化效果的大规模的研究,在美国、加拿大以及欧洲的多个中心进行。677名复发性多发性硬化病人被随机分配到Rebif和Avonex组,其中Rebif组339例,Avonex组338例。主要疗效终点为治疗24周后的无复发率。研究者把本试验设计为优效性试验,即证明Rebif优于Avonex,而在进行样本量计算时,则假定Rebif组和Avonex组治疗24周后的无复发率分别为65%和50%。研究结果显示,治疗24周后,Rebif组和Avonex组无复发率分别为74.9%和63.3%,p= 0.0005,而在其他的次要终点方面,Rebif组也显著优于Avonex组。最后研究结果证明,Rebif在治疗复发性多发性硬化方面比Avonex更有效。 关于阳性对照的试验,能作出优效来当然是最理想的结果,但研究者在设计这种试验时,往往会遇到一个难题,一是对照药物的选择,另一个就是你有没有把握作出优效来,如果你设计成优效试验,结果作出来确实优势,当然是皆大欢喜,但如果作不出来,两种药物没有统计学差异呢,这时对结果的解释和结论的得出往往就会变得比较复杂,最重要的一点是你不能因为两者没有统计学差异而得出两种药物疗效相当或者非劣效之类的结论,而造成结果无统计学差异的原因则有很多,并不是一句两种药物疗效相等所能解释的。 首先让我们来看两个例子:
研究1:随机、双盲、对照试验 (1) 比较两种溶栓药:SK和rt-PA (2) 主要终点:30天死亡率(两分类变量) (3) SK: 10370 例病人 rt-PA: 10348例病人 (4) SK: 7.4% rt-PA: 6.3% (5) 卡方检验: p=0.0028
研究2:随机、双盲、对照试验 (1) 比较两种溶栓药:A和B (2) 主要终点:30天死亡率(两分类变量) (3) A: 1000 例病人 B: 1000例病人 (4) A: 7.4% B: 6.3% (5) 卡方检验: p=0.37
从研究1和研究2,我们能得出什么结论? 研究1:差异有统计学意义,SK的疗效优于rt-PA 研究2:差异无统计学意义,能否得出A和B的疗效相同?
从上边的例子,我们可以看出,同样的30天死亡率,结果却大不相同。这里就涉及到一个对p值的正确认识的问题,这种问题在设计为优效性的试验中尤为常见。当p>0.05时,统计上说是无统计学意义,它的含义是根据当前数据,尚不足以认为两组间疗效差异具有统计学意义。 换句话说,p>0.05是一个不是结论的结论,从统计学上说它是结论,表示无统计学意义;从临床上说,它不是结论,既不能说两药有差别,也不能说两药无差别,可能例数过少或误差过大,增大例数或减少误差就可能达到p<0.05。就如上面的例子,当每组样本量从1000增加到10000时,同样的30天死亡率的比较就能达到p<0.05。因此,我们必须在这里强调的一点就是,不能仅仅从p>0.05就得出两药疗效相等的结论。 在优效性试验中,还会涉及到一个统计学差异与临床差异的问题。统计学差异很好理解,就是两组的差别有统计学意义,这个一般是由我们的p值或95%可信区间来判断的,而临床差异呢,就是从临床角度考虑两组的差别是具有临床意义的,举个例子来说,两种降压药降压差别在3mmHg以上才具有临床意义。 在考察差异的临床试验中,两组差异无外乎会出现下列4种结果: (1) 统计学和临床都有意义 (2) 统计学和临床都无意义 (3) 统计学有意义,临床无意义 (4) 统计学无意义,临床有意义 上边的四种情况中,出现第一种和第二种,那么结论比较明确。然而,当统计学和临床不一致时,即出现上边的第三和第四种情况时,则需要进行具体分析: (1) 当出现第三种情况时,即统计学有意义,临床无意义;这时我们不能以统计学上的意义来取代临床上的意义,为什么呢?很简单,不管真实差异多么小,当样本量足够大时,总会检验出两组具有统计学差异。例如,上边提及的降压药,如果两组实际差别也就是1mmHg,只要你的样本量足够大,上万,上十万,总能检验出统计学差异来,但这种差异无临床意义,如果是一种新药,那么这种药物本身也就失去了批准上市的意义。因此,这里小胖要特别提到的就是,考虑到这一点,当计算优效性试验的样本量时,你假设的两组差异必须在临床上是有意义的。 (2) 当出现第四种情况时,即统计学无意义,临床有意义;为什么会出现这种情况呢?很好理解,如果两组真实差异确实很大,但样本量太小,也会出现差异无统计学意义的结果。比如我们在上篇博文中提及的那个例子的研究2中,A组和B组30天死亡率分别为7.4%和6.3%,两者的差异是具有临床意义的,但由于样本量不够,差异无统计学意义;而当样本量增大时,同样的情况到了研究1中两组的差异就具有统计学意义了。 首先,给大家说一个非劣效试验的例子-Moxatag注册临床试验 2008年1月24日,Middlebrook制药有限公司宣布FDA已批准其开发的阿莫西林(amoxacillin)775mg缓释片Moxatag,用于每日一次口服治疗12岁及以上青少年和成人的继发于酿脓链球菌感染的咽炎和(或)扁桃体炎,而Moxatag则成为在美获得批准的第一个每日一次用阿莫西林缓释制剂。 而这次FDA批准的主要依据则正是一项随机双盲平行对照的非劣效试验。在这项试验中,对Moxatag每日一次和penicillin每日四次进行了比较,主要终点为细菌清除率。本试验设计为非劣效试验,即Moxatag在细菌清除率方面不劣于penicillin,非劣效界值为10%,即Moxatag在细菌清除率方面与penicillin相差不会超过10%。研究结果显示, Moxatag和penicillin的细菌清除率分别为85%和83.4%。两者相差的95%可信区间为(-5.1,8.2)。其95%可信区间的下限-5.1是大于非劣效界值-10的,因此可以证实非劣效性。另外本研究在其他次要终点方面也显示出了非劣效性。 在本试验证实了Moxatag和penicillin在疗效和安全性相当的基础上,与penicillin每日四次相比,Moxatag每日一次便成为了它的主要优势,医生们有了第一种可以每日一次使用治疗青少年和成人咽炎和(或)扁桃体炎的阿莫西林药物,这也就大大增加了服用的方便性,从而也提高了病人的依从性,这种每日一次的优势也最终促使FDA批准了此药物。 以上这个例子就是一个经典的非劣效试验,在证实疗效相当的基础上,通过自己药物的其他优势比如服用的方便性等来获得批准。 非劣效试验的目的在于证明试验组的疗效是否在在某个界值上不劣于对照组。当你设计非劣效试验时,既然你在疗效上没有什么特别的优势,那么你在别的方面就应该有自己的优势,比如说更便宜、更少的侵害、副作用更少、服用更方便等,这一点很重要,你必须找到一个你自己的优势,这个优势足以说服临床医生和药监部门,就小胖个人体会而言,这是你设计非劣效试验的理论基础和前提。让我们结合几个实例,来看一下非劣效试验设计时这方面的考虑: 1. 更便宜: Righini M, Le Gal G, Aujesky D, et al. Diagnosis of pulmonary embolism by multidetector CT alone or combined with venous ultrasonography of the leg: a randomised non-inferiority trial. Lancet 2008; 371: 1343-1352 这是一项比较多层CT或多层CT联合静脉超声诊断肺动脉栓塞的研究。在研究设计时,研究者参考了以往的一些相关研究发现多层CT作为一种单独诊断的方法是安全有效的,而在多层CT的基础上联合静脉超声的附加价值不大。如果能证明单独的多层CT不差于多层CT联合静脉超声,那么病人就会因为省略掉静脉超声而大大节省成本以及时间。因此,研究者设计了此项非劣效研究。
如何确定非劣效试验的判断界值
如何确定非劣效试验的判断界值LG GROUP system office room 【LGA16H-LGYY-LGUA8Q8-LGA162】发布日期化药药物评价>>临床安全性和有效性评价栏目如何确定非劣效试验的判断界值标题黄钦作者部门正文内容审评四部审评八室黄钦摘要:非劣效试验中判断试验药和阳性对照药疗效相当的疗效差异至关重要,也比较复杂,下文探讨了非劣效性试验界值确定的考虑要点及审评中的主要关注点。
关键词:非劣效性试验判断界值(margin)非劣效、等效和优效性试验的区间检验与传统假设检验最大的不同是考虑了临床意义,以临床意义的差异Δ来进行假设检验,那么,如何确定这个疗效差异的判断界值至关重要,若Δ太大,将把疗效远不如对照药的药物判断为有效或等效;若Δ太小,则可能将本来可以推广应用的有效药物误判为无效而得不到及时上市,并且所需的样本含量可能会大的不切实际,因此Δ的确定应当合适,理论上应该是药效间具有临床意义的最大允许差异值。
但实际确定起来往往较为困难和复杂,需要根据已有的文献数据,设计类型及数据的分布类型,临床认识水平及成本效益来综合考虑,是统计学推理和临床判断相结合的结果。
没有哪本书或指导原则能够给出一个精确无疑的算法。
非劣效试验的Δ值的确定最为复杂,通常参考阳性对照药与安慰剂间的疗效差异即阳性对照药的绝对疗效来判定,需要达到两个目标(满足两个条件)才是适合的判断界值:使试验药物(A)的疗效既要优于安慰剂(P)以保证药物的有效性(A-P>0),又要好到不差于阳性对照药(B)(A-B>-Δ)。
因此,ICH及EMEA等均推荐同时包括安慰剂对照和阳性对照药的三个试验组设计的研究,试验药必须证明在统计学意义上优于安慰剂(试验产品与安慰剂差异的双侧95%可信区间的下限必须大于0,如果试验药和参照药均未能显示在统计学意义上优于安慰剂,可能提示试验不灵敏或者是测定方法不灵敏),然后要用临床判断来评价所观察到的与安慰剂的差异是否具有临床意义。
EMEA优效性与非劣效性之间转换的考虑要点
EMEA《优效性与非劣效性之间转换的考虑要点》审评四部审评八室黄钦审校伦敦,2000年7月27日 CPMP/EWP/482/99I.前言许多近期的申报导致CPMP就优效性、非劣效性和等效性试验的解释进行讨论。
ICH E9(临床试验的统计学原则)中包含了这些问题。
ICH E10(对照组的选择)的第2步草案以及CPMP有关生物利用度和生物等效性研究指南的注释中也有进一步的相关材料。
但指南未说明实践中生物利用度的某些具体困难。
从更广的角度来说,这些困难与分析时从一个设计目的向另一个目标转换相关。
所讨论的试验的类型是那些设计用于比较新产品与活性对照药的试验。
目的可以是证明:l 新产品的优效性l 新产品的非劣效性或l 两种产品等效当获得试验结果时,它们可以提出另外的解释。
因此优效性试验的结果可能仅足以支持非劣效性,而非劣效性试验的结果可能显示出支持优效性。
另外,等效性试验的结果可以显示出支持更小范围内的等效性。
这一专题满意的方法需要理解可信区间以及得到试验结果和从这些结果中得出结论的方式。
这一理解还有助于我们认识到为什么试验结束后对把握度的计算意义不大。
为简便起见,本文从单个主要变量疗效研究的角度来说明优效性、非劣效性和等效性问题。
在VI节还对其他情况进行了评论。
整个本文件中假定临床目的的转换不会导致主要变量的选择或定义发生任何变化。
II.试验目的II.1优效性试验设计优效性试验是为了检出治疗间的差异。
分析的第一步通常是检验统计学意义,以评价试验结果是否与两种治疗的临床效果无差异的假设相符。
在质量好的试验中,统计学意义的程度(p值)提示观察到的差异(或较大的值)是偶然产生的,假定事实上并无差异。
概率越小,则假定治疗间真正无差异的可能性越小。
一旦认为“无差异”的假设不可靠,那么一定要估计差异的大小,以评价作用是否有临床意义。
这包括两个方面。
首先,有治疗间差异大小的最佳估计值(点估计)。
对于正态分布的数据,这通常是被看作每个组平均值间观察到的差异。
临床随机对照试验的统计分析
2020/12/2
.
21
假设检验类型
优效(Superiority): “试验组(E)优于对照组(C )”
等效(Equivalence): “试验组(E)与对照组(C )相当”
非劣效(Non-inferiority ):
“试验组(E) 比对照组(C ) 差但不多”
不良事件 不良事件
5
156
A组
20020423
20020618
失访
5
160
A组
20020514
20020802
其它
2
112
B组
20020522
20020607
失访
3
048
B组
20020517
20020518
不良事件
5
235
B组
20020507
20020521
失访
2020/12/2
.
14
未进入FAS、PPS人群者清单
以16周测定的HbA1c 相对基线(0周)变化值作为主要疗效指
标。 根据临床经验规定,如果试验组HbA1c不比阳性对照药差 0.3,即可判定试验药有效
2020/12/2
.
32
1)主要疗效指标治疗前后变化
2020/12/2
.
33
2)各中心主要疗效指标治疗前后变化
各试验中心主要疗效指标的基线和差值
HbAlc(%)
中心号 1 1 2 2 2 3 5 2 2 5 5
药物号 9 96 18
101 183 114 76 19 112 70 225
治疗分组 A组 A组 A组 A组 A组 A组 A组 B组 B组 B组 B组
非劣效研究是与非
二、非劣效性试验及其结果解读
(一)是否满足非劣效试验的基本原则
✓设计方案明确非劣效试验:事先设置(试验注册信息、Protocol发表)
✓设计之初事先确定非劣效值M1/M2:关键
• 从统计学意义角度先确定:非劣效值-M1
找索拉非尼与安慰剂比较RCTM1M2
• 从临床角度确定有意义的非劣效值-M2 M2<M1
(PD)为Ⅱ/Ⅲ期试验制定合适的剂量和方案提供依据
• 少量健康志愿者、患者参与,可能包括一个扩展队列以获得特定指标早期信息。
Ⅱ期临床试验:探索性试验- Can it work
• 目的:筛选具有抗肿瘤活性的肿瘤类型,初步确定适应症人群;以扩安大慰样剂本为量对进照一!步!考!核安全性,探索 临床反应剂量,产生假设,Ⅲ期临床试验进一步确定;
P=0.001
界值M2有理有据,不宜偏大或偏小 偏大,药效不达标新药因非劣效门槛低-劣药推向市场! 偏小,因非劣效门槛高而埋没有前景的好药!
96.5%!
仑伐/索拉HR95%CI上限为1.06 非劣效值为1.08 1.06小于1.08,仑伐非劣效索拉非尼!
REFLECT研究非劣效值取1.08合理吗?
13.9月>13.6月
PICOS
S=open label致测量偏倚风险(两组评价尺度不一) 不同终点效应指标:OS、PFS、TTP在同一研究中差别很大!有效性、安全性应综合利弊!
OS=+1.3m
OS=+1.3m
PFS=+3.7m
PFS=+3.7
P=0.004 P=0.012 TTP=+5.2m P<0.001
如果仅有一项试验或终点(例如,PFS),则需<0.025
医疗器械临床试验设计指导原则
附件医疗器械临床试验设计指导原则医疗器械临床试验是指在具备相应条件的临床试验机构中,对拟申请注册的医疗器械在正常使用条件下的安全有效性进行确认的过程。
临床试验是以受试人群(样本)为观察对象,观察试验器械在正常使用条件下作用于人体的效应或对人体疾病、健康状态的评价能力,以推断试验器械在预期使用人群(总体)中的效应。
由于医疗器械的固有特征,其试验设计有其自身特点。
本指导原则适用于产品组成、设计和性能已定型的医疗器械,包括治疗类产品、诊断类产品,不包括体外诊断试剂。
本指导原则是供申请人和审查人员使用的技术指导文件,不涉及注册审批等行政事项,亦不作为法规强制执行,如有能够满足法规要求的其他方法,也可以采用,但应提供详细的研究资料和验证资料。
应在遵循相关法规的前提下使用本指导原则。
一、医疗器械临床试验目的临床试验需设定明确、具体的试验目的。
申请人可综合分析试验器械特征、非临床研究情况、已在中国境内上市(下文简称已上市)同类产品的临床数据等因素,设定临床试验目的。
临床试验目的决定了临床试验各设计要素,包括主要评价指标、试验设计类型、对照试验的比较类型等,进而影响临床试验样本量。
不同情形下的临床试验目的举例如下:(一)当通过临床试验确认试验器械在其预期用途下的安全有效性时,若更关注试验器械的疗效是否可满足临床使用的需要,其临床试验目的可设定为确认试验器械的有效性是否优于/等效于/非劣于已上市同类产品,同时确认试验器械的安全性。
此时,临床试验的主要评价指标为有效性指标。
(二)当通过临床试验确认试验器械在其预期用途下的安全有效性时,若更关注试验器械的安全性是否可满足临床使用的需要,其临床试验目的可设定为确认试验器械的安全性是否优于/等效于/非劣于已上市同类产品,同时确认试验器械的有效性。
此时,临床试验的主要评价指标为安全性指标,以乳房植入体为例,临床试验通常选择并发症发生率(如包膜挛缩率、植入体破裂率)作为主要评价指标。
EMEA优效性与非劣效性之间转换的考虑要点
EMEA 《优效性与非劣效性之间转换的考虑要点》审评四部审评八室黄钦审校伦敦,2000 年7 月27 日CPMP/EWP/482/99I. 前言许多近期的申报导致CPMP就优效性、非劣效性和等效性试验的解释进行讨论。
ICH E9(临床试验的统计学原则)中包含了这些问题。
ICH E10 (对照组的选择)的第2步草案以及CPMP有关生物利用度和生物等效性研究指南的注释中也有进一步的相关材料。
但指南未说明实践中生物利用度的某些具体困难。
从更广的角度来说,这些困难与分析时从一个设计目的向另一个目标转换相关。
所讨论的试验的类型是那些设计用于比较新产品与活性对照药的试验。
目的可以是证明:l 新产品的优效性l 新产品的非劣效性或l 两种产品等效当获得试验结果时,它们可以提出另外的解释。
因此优效性试验的结果可能仅足以支持非劣效性,而非劣效性试验的结果可能显示出支持优效性。
另外,等效性试验的结果可以显示出支持更小范围内的等效性。
这一专题满意的方法需要理解可信区间以及得到试验结果和从这些结果中得出结论的方式。
这一理解还有助于我们认识到为什么试验结束后对把握度的计算意义不大。
为简便起见,本文从单个主要变量疗效研究的角度来说明优效性、非劣效性和等效性问题。
在VI 节还对其他情况进行了评论。
整个本文件中假定临床目的的转换不会导致主要变量的选择或定义发生任何变化。
II. 试验目的II.1 优效性试验设计优效性试验是为了检出治疗间的差异。
分析的第一步通常是检验统计学意义,以评价试验结果是否与两种治疗的临床效果无差异的假设相符。
在质量好的试验中,统计学意义的程度(p 值)提示观察到的差异(或较大的值)是偶然产生的,假定事实上并无差异。
概率越小,则假定治疗间真正无差异的可能性越小。
一旦认为“无差异”的假设不可靠,那么一定要估计差异的大小,以评价作用是否有临床意义。
这包括两个方面。
首先,有治疗间差异大小的最佳估计值(点估计)。
对于正态分布的数据,这通常是被看作每个组平均值间观察到的差异。
非劣效性队列研究
非劣效性队列研究非劣效性临床试验已成为评估药物、器械、生物制剂和其他疗法的主要工具,其初衷是寻找好的替代疗法,然而设计缺陷往往导致弄巧成拙。
安全性评估非劣效性研究设计越来越多地用于评估新疗法的安全性。
评估安全性的非劣效性研究设计面临一个特殊挑战,即通常并无支持安全性界值的合理数据。
取而代之的是,临床顾问必须决定什么水平的不良事件是可以接受的。
该水平可能会因事件严重程度、患者群体绝对风险以及治疗预期获益不同而有所不同。
在PRECISION(塞来昔布相对于布洛芬或萘普生的安全性前瞻性随机评估Prospective Randomized Evaluation of Celecoxib Integrated Safety versus Ibuprofen or Naproxen)中,研究者评估了塞来昔布与萘普生相比,在治疗关节炎方面的非劣效性,根据主要复合终点(心血管原因[包括出血]所致死亡、非致死性心肌梗死或非致死性卒中)的预期年度风险2%,选择了1.33作为安全性的相对界值。
虽然这是一项包含三组的试验,但第三组不接受安慰剂而是接受布洛芬治疗,作为塞来昔布的第二项非劣效性比较。
在10年研究期间,停药率接近80%,表明药物试验易出现依从性达不到100%的情况。
然而,无论在主要的意向性治疗分析中,还是在次要的实际治疗分析中,塞来昔布均不劣于萘普生和布洛芬。
当研究人群心血管结局的实际风险为预期风险的一半时,出现了另外一个挑战。
尽管使用相对非劣效性界值可以保持该低危人群的非劣效性检验效度,但数据和安全性监查委员会发现,在对事件总发生率所做的检验中,该研究功效不足,因此样本量从计划招募约20,000名参与者增加到最终纳入24,081名参与者。
最后,因为在纳入慢性疼痛患者的研究中不应设置安慰剂对照,所以PRECISION 试验并未证明其中任何药物的心血管风险未增加(即药物不劣于安慰剂)。
新试验方法及其对非劣效性研究的影响简化试验实施过程(减少与参与者的联系次数和评估的结局数量)能够更可靠地确认较大样本量,并且可能减少由缺失数据引入的偏倚,从而有利于优效性和非劣效性试验。
药物临床试验非劣效设计指导原则2020版
20207一、概述 (1)二、应用条件 (1)(一)阳性对照药疗效的既往证据 (2)(二)恒定假设 (2)(三)良好的研究质量 (3)三、设计要点 (3)(一)统计假设 (3)(二)阳性对照药 (4)(三)分析人群 (4)四、非劣效界值确定与统计推断 (5)(一)固定界值法 (6)(二)综合法 (8)五、其他考虑 (9)(一)相对于疗效损失的潜在获益 (9)(二)非劣效与优效检验的转换 (9)(三)三臂非劣效设计 (9)(四)与监管机构的沟通 (10)附录1:中英文词汇对照 (11)附录2:主要公式 (12)(一)固定界值法 (12)(二)综合法 (12)附录3:应用示例 (13)(一)固定界值法 (13)(二)综合法 (14)一、概述当确证某个药物疗效时,优效试验(如证明试验药与安慰剂或阳性药相比较的优效性)一般是理想选择。
当优效试验不适用,比如使用安慰剂对照不符合伦理要求时,可考虑采用非劣效试验。
非劣效试验是为了确证试验药的临床疗效,即使低于阳性对照药,但其差异也是在临床可接受范围之内。
本指导原则旨在阐述非劣效试验的应用条件、设计要点、非劣效界值设定、统计推断以及其他监管考虑等方面内容,以指导临床试验各相关方能够正确地认识、实施和评价非劣效试验。
本指导原则主要适用于支持药品注册上市的确证性临床试验,也可供探索性临床试验参考使用。
二、应用条件非劣效试验以阳性药作为对照,目的是确证虽然试验药的疗效低于阳性对照药的疗效,但差异在可接受的范围之内。
非劣效试验中阳性对照药相对于安慰剂的疗效无法在本试验中直接观察,因此需要假定阳性对照药有确切的疗效。
非劣效试验应确保具有足够的检定敏感性,即具有区分阳性对照药为有效、低效或无效的能力。
关于检定敏感性的详细阐述可参考ICH E10《临床试验中对照组的选择和相关问题》。
要确保非劣效试验具有一定的敏感性,应着重考虑以下三个方面:(一)阳性对照药疗效的既往证据通常阳性对照药相对于安慰剂的疗效差异来源于已知的、具有良好设计和实施的临床试验结果。
临床试验常用样本量的计算方法
临床试验常用样本量的计算方法临床试验是评价医疗干预措施有效性和安全性的重要方法之一、在进行临床试验时,合理的样本量计算是确保试验具有统计学意义和科学可靠性的重要步骤之一、本文将从试验目的、效应大小、错误类型和统计方法等方面介绍临床试验常用的样本量计算方法。
一、试验目的在进行样本量计算之前,首先需要明确试验的目的是什么。
不同的试验目的对样本量计算有不同的要求。
1.描述性试验:描述性试验是旨在描述和概括人群特征、疾病频率、新技术的性能等,通常不涉及统计检验。
在这种类型的试验中,样本量的计算往往以统计学为基础,根据置信区间长度或精确度来确定。
2.比较试验:比较试验是旨在比较不同干预措施的效果,常见的包括药物疗效的比较、手术效果的比较等。
在这种类型的试验中,需要确定试验的主要效应大小。
二、效应大小效应大小是指试验结果中真实存在的干预效果的大小。
样本量计算中需要考虑到主要效应的大小,以使试验能够检测到具有意义的差异。
1.非劣效(非劣效)试验:非劣效试验是以疗效差异的下限边界(非劣效界)为基础,判断新干预措施是否与已有干预措施相当。
样本量计算需要根据监测期望的非劣效界来确定。
2.等效性试验:等效性试验是旨在证明两种干预措施的疗效相当。
在这种类型的试验中,需要确定非劣效界,并根据非劣效界来计算样本量。
3.优势试验:优势试验是旨在证明新的干预措施是否优于已有干预措施。
样本量计算需要确定所期望的主要效应大小、显著性水平和统计功效,以及预期的丢失率和失败率。
三、错误类型在进行临床试验时,需要考虑两类错误:第一类错误(α错误)和第二类错误(β错误)。
样本量计算需要控制这两类错误的概率。
1.第一类错误(α错误)是指在实际上不存在差异的情况下,错误地拒绝原假设(即错误地得出差异存在的结论)。
控制α错误的概率可以通过选择适当的显著性水平来实现。
2.第二类错误(β错误)是指在实际上存在差异的情况下,错误地接受原假设(即错误地得出差异不存在的结论)。
非劣效临床试验的统计学考虑
非劣 效 临床试验 的 目的是 通过 与 阳性 对 照的 比较
评 价试验 药物 的有效 性 和安全 性 。 良好设 计 的非 劣效 试 验获 得 的临 床 研 究 数据 可 以推 断 出 : 1 拒 绝 试 验 () 药 物 的疗 效劣 于 阳性 对 照药 物 疗 效 的假 设 , 即试 验 药 物 的疗效 非 劣 于 阳性 对 照 ; ( ) 或 2 尚不 能 拒 绝 试 验 药 物 的疗 效劣 于 阳性 对 照药物 的疗效 。 非 劣效 的结论 有 两层 含 义 : 验 药 的疗 效 优 于安 试 慰剂( 间接推 论试 验药 物 的有效 性 ) 试验 药 的 疗效 若 ;
计 2 1 0 2年 4月第 2 9卷第 2期
・
C T C S专 家 共识 ・
・ ‘ ◆ ” ◆ …・ ◆ ・ ◆ ◆ ◆ ◆ ’◆ ◆ ◆ ◆ ’・ ◆ ◆ ・ …◆ ・ ・ ◆ …・ ◆ …・ ・ ” ・ ◆ ・ ・ ◆ ¨
定 困难 。基 于此 , 临床 试 验 中 提 出 了采 用 阳性 对 照 的 非 劣效 ( o — fr ry NI 试 验 设 计 , 类 设 计 中 阳 n ni e o t , ) n ii 此 性对 照 的选择 , 劣效 界 值 的 确定 , 本 量 的估 计 , 非 样 统 计 推断 方法 等方 面均涉 及 到统计学 问题 。
,
—
i
・
◆
非 劣 效 临 床 试 验 的 统 计 学 考 虑
C T 工作小组 夏 结 来 CS 执 笔
鉴 于非劣 效 临床试 验 在 国 内开展 地 比较 广 泛 , 但 在研 究设 计和评 价 方 面 尚未 形 成相 对 统 一 的认 识 , 为 此 中 国临床试 验生 物统 计 学 工 作 小组 ( C S , 充 C T )经 分讨 论 , 2 1 于 0 1年 1 0月 3 日于南 京汤 山 召开工 作 会 0
