FTS(Fault Tolerance Serve)是GreenPlum中的故障检测服务，是保证GP高可用的核心功能。GreenPlum的Segment的健康检测及HA是由GP Master实现的，GP Master上面有个专门的进程–FTS进程，它可以快速检测到Primary或者Mirror是否挂掉，并及时作出Primary/Mirror 故障切换。如果FTS挂掉了，Master将会重新fork出来一个FTS进程。

FTS实现原理

GP Master上面的FTS进程每隔60s(时间可以配置)向Primary或者Mirror发送心跳包，Primary和Mirror收到心跳包后返回它们的当前状态，FTS进程心跳包的发送状态和Segment返回状态更新元信息和作出故障切换。因为Segment可能很多，为了加快检测速度，FTS是多线程的，默认16个线程。

实现检测方法的源码大致如下：

    while (!probeGetIpAddr(&probeInfo) ||
           !probeOpenSocket(&probeInfo) ||
           !probeMarkSocketNonBlocking(&probeInfo) ||
           !probeConnect(&probeInfo) ||
           !probeSend(&probeInfo) ||
           !probeReceive(&probeInfo) ||
           !probeProcessResponse(&probeInfo))
    {
        probeClose(&probeInfo);
        if (retryCnt == gp_fts_probe_retries)
        {
            write_log("FTS: failed to probe segment (content=%d, dbid=%d) after trying %d time(s), "
                      "maximum number of retries reached.",
                      probeInfo.segmentId,
                      probeInfo.dbId,
                      retryCnt);
            break;
        }

        /* sleep for 1 second to avoid tight loops */
        pg_usleep(USECS_PER_SEC);
        retryCnt++;
        //other code
    }

while (!probeGetIpAddr(&probeInfo) ||

!probeOpenSocket(&probeInfo) ||

!probeMarkSocketNonBlocking(&probeInfo) ||

!probeConnect(&probeInfo) ||

!probeSend(&probeInfo) ||

!probeReceive(&probeInfo) ||

!probeProcessResponse(&probeInfo))

{

probeClose(&probeInfo);

if (retryCnt == gp_fts_probe_retries)

{

write_log("FTS: failed to probe segment (content=%d, dbid=%d) after trying %d time(s), "

"maximum number of retries reached.",

probeInfo.segmentId,

probeInfo.dbId,

retryCnt);

break;

}

/* sleep for 1 second to avoid tight loops */

pg_usleep(USECS_PER_SEC);

retryCnt++;

//other code

}

Segment检测及故障切换

GP Master首先会检测Primary状态，如果Primary不可连通，那么将会检测Mirror状态，Primary/Mirror状态总共有4种：

Primary活着，Mirror活着。GP Master探测Primary成功之后直接返回，进行下一个Segment检测；
Primary活着，Mirror挂了。GP Master探测Primary成功之后，通过Primary返回的状态得知Mirror挂掉了（Mirror挂掉之后，Primary将会探测到，将自己变成ChangeTracking模式），这时候更新Master元信息，进行下一个Segment检测；
Primary挂了，Mirror活着。GP Master探测Primary失败之后探测Mirror，发现Mirror是活着，这时候更新Master上面的元信息，同时使Mirror接管Primary（故障切换），进行下一个Segment检测；
Primary挂了，Mirror挂了。GP Master探测Primary失败之后探测Mirror，Mirror也是挂了，直到重试最大值，结束这个Segment的探测，也不更新Master元信息了，进行下一个Segment检测。

参数配置

gp_fts_probe_threadcount

用来故障检测的线程数量，默认为16。

gp_fts_probe_interval

两次检测的时间间隔，默认为60s。如果一次检测时间使用10s，那么剩余50s将会sleep;如果超过60s，将会直接进入下一次检测。

gp_fts_probe_timeout

检测Segment超时时间，默认值: 20。

gp_fts_probe_retries

检测Segment失败重试次数，如果超过这个次数，将会认为当前节点挂掉，默认值: 5。

gp_segment_connect_timeout

Prmary和Mirror文件同步允许连接Mirror最大超时时间，如果达到这个超时时间，Primary将会认为Mirror挂掉了，默认值: 180s。

本人提供Oracle(OCP、OCM)、MySQL(OCP)、PostgreSQL(PGCA、PGCE、PGCM)等数据库的培训和考证业务，私聊QQ646634621或微信db_bao，谢谢！

后续精彩内容已被小麦苗无情隐藏，请输入验证码解锁本站所有文章！

请先关注本站微信公众号，然后回复“验证码”，获取验证码。在微信里搜索“DB宝”或者“www_xmmup_com”或者微信扫描右侧二维码都可以关注本站微信公众号。

打赏赞(1)

标签： GreenPlum

小麦苗

学习或考证，均可联系麦老师，请加微信db_bao或QQ646634621

发表回复取消回复

要发表评论，您必须先登录。

2024年 4月
一	二	三	四	五	六	日
1	2	3	4	5	6	7
8	9	10	11	12	13	14
15	16	17	18	19	20	21
22	23	24	25	26	27	28
29	30

嘿，我是小麦，需要帮助随时找我哦。

18509239930
个人微信
DB宝
个人邮箱
点击加入QQ群
个人微店
回到顶部

合 GreenPlum中的FTS故障检测原理