Monitorizarea performanței interogărilor PostgreSQL. Partea 1 — raportare

Inginer — tradus din latină ca fiind inspirat.
Inginerul poate face orice. (c) R.Diesel.
Epigrafe.
Monitorizarea performanței interogărilor PostgreSQL. Partea 1 — raportare
Sau povestea despre de ce un administrator de baze de date ar trebui să-și amintească trecutul de programator.

Prefață

Toate numele sunt modificate. Coincidențele sunt întâmplătoare. Materialul reprezintă exclusiv opinia personală a autorului.

Declinarea garanțiilor: în ciclul planificat de articole nu va exista o descriere detaliată și exactă a tabelelor și scripturilor folosite. Materialele nu pot fi utilizate imediat „CA ATARE”.
În primul rând, din cauza volumului mare de material,
în al doilea rând, din cauza adaptării la baza de producție a clientului real.
De aceea, în articole vor fi prezentate doar idei și descrieri în cele mai generale termeni.
Poate, în viitor, sistemul va ajunge la nivelul de a fi publicat pe GitHub, poate nu. Timpul va arăta.

Începutul poveștii- „Îți amintești cum a început totul».
Ce s-a obținut în rezultat, în cele mai generale contururi- „Sinteză ca o metodă de îmbunătățire a performanței PostgreSQL»

De ce îmi trebuie asta?

Ei bine, în primul rând, pentru a nu uita, în amintiri, în pensionare, zilele glorioase.
În al doilea rând, pentru a sistematiza ceea ce am scris. Căci deja, uneori, încep să mă încurc și să uit părți separate.

Și cel mai important — poate că va fi de folos cuiva și va ajuta să nu reinventeze bicicleta și să nu strângă greble. Cu alte cuvinte, să-și îmbunătățească karma (nu cea de pe Habr). Căci, cel mai valoros lucru în această lume sunt ideile. Principalul este să găsești o idee. Iar a implementa o idee în realitate este deja o problemă pur tehnică.

Deci, să începem, încet…

Stabilirea sarcinii.

Există:

Baza de date PostgreSQL(10.5), de tip mixt de încărcare (OLTP+DSS), cu o încărcare medie-mică, situată în cloud AWS.
Monitorizarea bazei de date lipsește, iar monitorizarea infrastructurii este prezentată sub forma instrumentelor standard AWS în configurație minimă.

Este necesar:

Monitorizarea performanței și stării bazei de date, găsirea și obținerea informațiilor inițiale pentru optimizarea interogărilor grele către baza de date.

O scurtă prefață sau analiză a variantelor de soluție

Pentru început, vom încerca să analizăm variantele de soluție a sarcinii din perspectiva unei analize comparative a beneficiilor și neplăcerilor pentru inginer, iar beneficiile și pierderile managementului să fie lăsate celor care sunt desemnați pentru asta conform organigramei.

Varianta 1- „Lucrând la cerere”

Lăsăm totul așa cum este. Dacă clientul nu este mulțumit de funcționarea, performanța bazei de date sau a aplicației, acesta va informa inginerii DBA prin e-mail sau va crea un incident în sistemul de ticketing.
Inginerul, după ce primește notificarea, se va ocupa de problemă, va propune o soluție sau va pune problema pe un plan secundar, sperând că totul se va rezolva de la sine și, oricum, curând totul va fi uitat.
Prăjituri și gogoși, vânătăi și umflăturiPrăjituri și gogoși:
1. Nu trebuie să facem nimic în plus.
2. Sempre există posibilitatea de a te eschiva și a evita responsabilitățile.
3. O mulțime de timp pe care îl putem petrece după bunul plac.
Vânătăi și umflături:
1. Mai devreme sau mai târziu, clientul se va gândi la esența existenței și la justiția universală în această lume și se va întreba din nou — de ce plătesc eu acești bani? Consecința este întotdeauna aceeași — întrebarea este doar când clientul se va plictisi și va renunța. Și sursa de venit se va goli. Este trist.
2. Dezvoltarea inginerului — zero.
3. Dificultăți în planificarea muncii și a încărcării.

Varianta 2 - „Danțuim cu tobe, vândem și încălțăm”

Punctul 1- De ce să avem un sistem de monitorizare, vom obține totul prin cereri. Vom lansa o mulțime de cereri către dicționarul de date și prezentări dinamice, activăm diverse contoruri, combinăm totul în tabele, analizăm periodic listele și tabelele. Drept rezultat, avem grafice frumoase sau nu foarte frumoase, tabele, rapoarte. Principalul este să fie cât mai multe.
Punctul 2- Generăm activitate — lansăm analiza tuturor acestora.
Punctul 3- Pregătim un document oarecare, numim acest document pur și simplu — „cum să ne organizăm baza de date”.
Punctul 4- Clientul, văzând toate aceste minunate grafice și cifre, se află într-o naivitate copilărească — acum cu siguranță totul va funcționa, în curând. Și renunță cu ușurință și fără durere la resursele sale financiare. Managementul este, de asemenea, încrezător — inginerii noștri lucrează excelent. Încărcarea este la maxim.
Punctul 5- Se repetă periodic Punctul 1.
Prăjituri și gogoși, vânătăi și umflăturiPrăjituri și gogoși:
1. Viața managerilor și inginerilor este simplă, previzibilă și plină de activitate. Totul zumzăie, toți sunt ocupați.
2. Viața clientului nu este rău — el este întotdeauna convins că trebuie să mai aibă puțină răbdare și totul se va rezolva. Se mai strică, ei bine, ce să faci — acesta este o lume nedreaptă, în viața următoare — va avea noroc.
Vânătăi și umflături:
1. Mai devreme sau mai târziu, va apărea un furnizor mai rapid de servicii similare, care va face același lucru, dar un pic mai ieftin. Și dacă rezultatul este același, de ce să plătești mai mult? Aceasta va duce la dispariția surselor de venit.
2. Este plictisitor. Așa cum este plictisitoare orice activitate lipsită de sens.
3. Ca și în varianta anterioară – nu există nicio dezvoltare. Dar pentru inginer, dezavantajul este că, spre deosebire de prima variantă, aici trebuie să genereze constant date despre bazele de date. Și acest lucru consumă timp. Timp pe care îl poți folosi în mod util pentru tine. Căci dacă nu ai grijă de tine, nimeni nu se va interesa de tine.

Varianta 3 – Nu trebuie să reinventezi roata, trebuie să o cumperi și să te plimbi.

Inginerii altor companii nu mănâncă pizza și nu beau bere degeaba (ah, vremurile grozave din Sankt Petersburg în anii '90). Să folosim sistemele de monitorizare care sunt deja create, bine reglate și care, de fapt, aduc un beneficiu (cel puțin pentru creatorii lor).
Prăjituri și gogoși, vânătăi și umflăturiPrăjituri și gogoși:
1. Nu trebuie să pierzi timpul inventând ceea ce a fost deja inventat. Ia-l și folosește-l.
2. Sistemele de monitorizare nu sunt scrise de prosti și, desigur, sunt utile.
3. Sistemele de monitorizare funcționale oferă, de obicei, informații utile și filtrate.
Vânătăi și umflături:
1. Inginerul în acest caz nu este un inginer, ci doar un utilizator al unui produs străin. Sau un user.
2. Trebuie să convingi clientul de necesitatea de a cumpăra ceva în care, de fapt, nu vrea să se implice, nici nu ar trebui, iar bugetul pe anul acesta este deja aprobat și nu se va schimba. Apoi, trebuie să aloci o resursă separată, să configurezi pentru sistemul respectiv. Adică, mai întâi trebuie să plătești, să plătești și iar să plătești. Iar clientul este zgârcit. Asta este norma acestei vieți.

Ce să facem - Cernîșevski? Întrebarea ta este foarte pertinentă. (c)

În această situație specifică și dată, se poate proceda puțin diferit – hai să facem propriul nostru sistem de monitorizare.
Monitorizarea performanței interogărilor PostgreSQL. Partea 1 — raportare
Nu un sistem bineînțeles, în sensul propriu al cuvântului, este prea mult spus și arogant, dar măcar să ne ușurăm sarcina și să adunăm mai multe informații pentru rezolvarea incidentelor de performanță. Ca să nu ne aflăm în situația – „mergi acolo, nu știu unde, găsește asta, nu știu ce”.

Care sunt avantajele și dezavantajele acestei variante:

Pro:
1. Este interesant. Cel puțin mai interesant decât constantul „shrink datafile, alter tablespace, etc.”
2. Acestea sunt abilități noi și o nouă dezvoltare. Ceea ce, în perspectivă, va aduce, mai devreme sau mai târziu, recompense meritate și bonusuri.
Dezavantaje:
1. Va trebui să muncim. Să muncim mult.
2. Va trebui să explicăm regulat sensul și perspectivele întregii activități.
3. Va trebui să renunțăm la ceva, pentru că singura resursă disponibilă pentru inginer, timpul, este limitată de Univers.
4. Cel mai înfricoșător și neplăcut — ca rezultat, poate ieși un lucru de genul „Nici șoricel, nici broască, ci o ființă necunoscută.”

Cine nu riscă, nu bea șampanie.
Așadar — începe cea mai interesantă parte.

Ideea generală — schematic

Monitorizarea performanței interogărilor PostgreSQL. Partea 1 — raportare
(Ilustrația este preluată dintr-un articol «Sinteză ca o metodă de îmbunătățire a performanței PostgreSQL»)

Explicație:

  • În baza țintă se instalează extensia standard PostgreSQL — “pg_stat_statements.”
  • În baza de date de monitorizare, creăm un set de tabele de servicii pentru a stoca istoricul pg_stat_statements în prima etapă și pentru a configura metricile și monitorizarea în continuare.
  • Pe hostul de monitorizare, creăm un set de scripturi bash, inclusiv pentru generarea incidentelor în sistemul de tichete.

Tabele de servicii

Pentru început, schematic-și simplificat, o ERD, ce a rezultat în final:
Monitorizarea performanței interogărilor PostgreSQL. Partea 1 — raportare
Descriere scurtă a tabelelorendpoint — host, punct de conectare la instanță
database — parametrii bazei de date
pg_stat_history — tabel istoric pentru stocarea instantaneelor temporale ale vederii pg_stat_statements a bazei de date țintă
metric_glossary — glosar de metrici de performanță
metric_config — configurația metricilor individuale
metric — metrică specifică pentru interogarea monitorizată
metric_alert_history — istoric al avertizărilor de performanță
log_query — tabel de serviciu pentru stocarea înregistrărilor analizate din fișierul de jurnal PostgreSQL descărcat de la AWS
baseline — parametrii perioadei temporale utilizate ca bază
checkpoint — configurația metricilor de verificare a stării bazei de date
checkpoint_alert_history — istoric al avertizărilor metricilor de verificare a stării bazei de date
pg_stat_db_queries — tabel de serviciu pentru interogările active
activity_log — tabel de serviciu pentru jurnalul de activitate
trap_oid — tabel de serviciu pentru configurația trap

Etapa 1 — colectăm informații statistice despre performanță și obținem rapoarte

Pentru stocarea informațiilor statistice, se folosește tabelul pg_stat_history
Structura tabelului pg_stat_history

                                          Tabel "public.pg_stat_history"
       Coloană      |            Tip              |                          Modificatori
--------------------+-----------------------------+-------------------------------------------
 id                 | integer                     | not null default nextval('pg_stat_history_id_seq'::regclass)
 snapshot_timestamp   | timestamp fără zonă orară  |
 database_id        | integer                     |
 dbid               | oid                         |
 userid             | oid                         |
 queryid            | bigint                      |
 query              | text                        |
 calls              | bigint                      |
 total_time         | double precision            |
 min_time           | double precision            |
 max_time           | double precision            |
 mean_time          | double precision            |
 stddev_time        | double precision            |
 rows               | bigint                      |
 shared_blks_hit    | bigint                      |
 shared_blks_read   | bigint                      |
 shared_blks_dirtied| bigint                      |
 shared_blks_written | bigint                      |
 local_blks_hit     | bigint                      |
 local_blks_read    | bigint                      |
 local_blks_dirtied | bigint                      |
 local_blks_written  | bigint                      |
 temp_blks_read     | bigint                      |
 temp_blks_written   | bigint                      |
 blk_read_time      | double precision            |
 blk_write_time     | double precision            |
 baseline_id        | integer                     |
Indexes:
    "pg_stat_history_pkey" CHEIE PRIMARĂ, btree (id)
    "database_idx" btree (database_id)
    "queryid_idx" btree (queryid)
    "snapshot_timestamp_idx" btree (snapshot_timestamp)
Constrângeri de cheie externă:
    "database_id_fk" CHEIE EXTERNĂ (database_id) REFERA la database(id) ON DELETE CASCADE

După cum se poate observa, tabelul reprezintă doar date cumulative ale vederii pg_stat_statements în baza de date țintă.

Utilizarea acestui tabel este foarte simplă

pg_stat_history va reprezenta o statistică acumulată a execuției interogărilor pentru fiecare oră. La începutul fiecărei ore, după completarea tabelului, statisticile pg_stat_statements sunt resetate prin pg_stat_statements_reset().
Notă: statistica este colectată pentru interogări cu o durată de execuție mai mare de 1 secundă.
Umplerea tabelului pg_stat_history

--pg_stat_history.sql
CREATE OR REPLACE FUNCTION pg_stat_history( ) RETURNS boolean AS $$
DECLARE
  endpoint_rec record ;
  database_rec record ;
  pg_stat_snapshot record ;
  current_snapshot_timestamp timestamp without time zone;
BEGIN
  current_snapshot_timestamp = date_trunc('minute',now());  
  
  FOR endpoint_rec IN SELECT * FROM endpoint 
  LOOP
    FOR database_rec IN SELECT * FROM database WHERE endpoint_id = endpoint_rec.id 
	  LOOP
	    
		RAISE NOTICE 'SE ÎNCEPE CREAREA NOII IMAGINI';
		
		--Conectare la DB-ul țintă	  
	    EXECUTE 'SELECT dblink_connect(''LINK1'',''host='||endpoint_rec.host||' dbname='||database_rec.name||' user=USER password=PASSWORD '')';
 
        RAISE NOTICE 'gazdă % și dbname % ',endpoint_rec.host,database_rec.name;
		RAISE NOTICE 'Crearea imaginilor pg_stat_statements pentru baza de date %',database_rec.name;
		
		SELECT 
	      *
		INTO 
		  pg_stat_snapshot
	    FROM dblink('LINK1',
	      'SELECT 
	       dbid , SUM(calls),SUM(total_time),SUM(rows) ,SUM(shared_blks_hit) ,SUM(shared_blks_read) ,SUM(shared_blks_dirtied) ,SUM(shared_blks_written) , 
           SUM(local_blks_hit) , SUM(local_blks_read) , SUM(local_blks_dirtied) , SUM(local_blks_written) , SUM(temp_blks_read) , SUM(temp_blks_written) , SUM(blk_read_time) , SUM(blk_write_time)
	       FROM pg_stat_statements WHERE dbid=(SELECT oid from pg_database where datname=current_database() ) 
		   GROUP BY dbid
  	      '
	               )
	      AS t
	       ( dbid oid , calls bigint , 
  	         total_time double precision , 
	         rows bigint , shared_blks_hit bigint , shared_blks_read bigint ,shared_blks_dirtied bigint ,shared_blks_written	 bigint ,
             local_blks_hit	 bigint ,local_blks_read bigint , local_blks_dirtied bigint ,local_blks_written bigint ,
             temp_blks_read	 bigint ,temp_blks_written bigint ,
             blk_read_time double precision , blk_write_time double precision	  
	       );
		 
		INSERT INTO pg_stat_history
          ( 
		    snapshot_timestamp  ,database_id  ,
			dbid , calls  ,total_time ,
            rows ,shared_blks_hit  ,shared_blks_read  ,shared_blks_dirtied  ,shared_blks_written ,local_blks_hit , 	 
            local_blks_read,local_blks_dirtied,local_blks_written,temp_blks_read,temp_blks_written, 	
            blk_read_time, blk_write_time 
		  )		  
	    VALUES
	      (
	       current_snapshot_timestamp ,
		   database_rec.id ,
	       pg_stat_snapshot.dbid ,pg_stat_snapshot.calls,
	       pg_stat_snapshot.total_time,
	       pg_stat_snapshot.rows ,pg_stat_snapshot.shared_blks_hit ,pg_stat_snapshot.shared_blks_read ,pg_stat_snapshot.shared_blks_dirtied ,pg_stat_snapshot.shared_blks_written , 
           pg_stat_snapshot.local_blks_hit , pg_stat_snapshot.local_blks_read , pg_stat_snapshot.local_blks_dirtied , pg_stat_snapshot.local_blks_written , 
	       pg_stat_snapshot.temp_blks_read , pg_stat_snapshot.temp_blks_written , pg_stat_snapshot.blk_read_time , pg_stat_snapshot.blk_write_time 	   
	      );		   
		  
        RAISE NOTICE 'Crearea imaginii pg_stat_statements pentru interogările cu timp_min mai mare de 1000ms';
	
        FOR pg_stat_snapshot IN
          --Toate interogările cu max_time mai mare de 1000 ms
	      SELECT 
	        *
	      FROM dblink('LINK1',
	        'SELECT 
	         dbid , userid ,queryid,query,calls,total_time,min_time ,max_time,mean_time, stddev_time ,rows ,shared_blks_hit ,
			 shared_blks_read ,shared_blks_dirtied ,shared_blks_written , 
             local_blks_hit , local_blks_read , local_blks_dirtied , 
			 local_blks_written , temp_blks_read , temp_blks_written , blk_read_time , 
			 blk_write_time
	         FROM pg_stat_statements 
			 WHERE dbid=(SELECT oid from pg_database where datname=current_database() AND min_time >= 1000 ) 
  	        '

	                  )
	        AS t
	         ( dbid oid , userid oid , queryid bigint ,query text , calls bigint , 
  	           total_time double precision ,min_time double precision	 ,max_time double precision	 , mean_time double precision	 ,  stddev_time double precision	 , 
	           rows bigint , shared_blks_hit bigint , shared_blks_read bigint ,shared_blks_dirtied bigint ,shared_blks_written	 bigint ,
               local_blks_hit	 bigint ,local_blks_read bigint , local_blks_dirtied bigint ,local_blks_written bigint ,
               temp_blks_read	 bigint ,temp_blks_written bigint ,
               blk_read_time double precision , blk_write_time double precision	  
	         )
	    LOOP
		  INSERT INTO pg_stat_history
          ( 
		    snapshot_timestamp  ,database_id  ,
			dbid ,userid  , queryid  , query  , calls  ,total_time ,min_time ,max_time ,mean_time ,stddev_time ,
            rows ,shared_blks_hit  ,shared_blks_read  ,shared_blks_dirtied  ,shared_blks_written ,local_blks_hit , 	 
            local_blks_read,local_blks_dirtied,local_blks_written,temp_blks_read,temp_blks_written, 	
            blk_read_time, blk_write_time 
		  )		  
	      VALUES
	      (
	       current_snapshot_timestamp ,
		   database_rec.id ,
	       pg_stat_snapshot.dbid ,pg_stat_snapshot.userid ,pg_stat_snapshot.queryid,pg_stat_snapshot.query,pg_stat_snapshot.calls,
	       pg_stat_snapshot.total_time,pg_stat_snapshot.min_time ,pg_stat_snapshot.max_time,pg_stat_snapshot.mean_time, pg_stat_snapshot.stddev_time ,
	       pg_stat_snapshot.rows ,pg_stat_snapshot.shared_blks_hit ,pg_stat_snapshot.shared_blks_read ,pg_stat_snapshot.shared_blks_dirtied ,pg_stat_snapshot.shared_blks_written , 
           pg_stat_snapshot.local_blks_hit , pg_stat_snapshot.local_blks_read , pg_stat_snapshot.local_blks_dirtied , pg_stat_snapshot.local_blks_written , 
	       pg_stat_snapshot.temp_blks_read , pg_stat_snapshot.temp_blks_written , pg_stat_snapshot.blk_read_time , pg_stat_snapshot.blk_write_time 	   
	      );
		  
        END LOOP;

        PERFORM dblink_disconnect('LINK1');  
				
	  END LOOP ;--FOR database_rec IN SELECT * FROM database WHERE endpoint_id = endpoint_rec.id 
    
  END LOOP;

RETURN TRUE;  
END
$$ LANGUAGE plpgsql;

Ca urmare, după o anumită perioadă de timp în tabel pg_stat_history vom avea un set de instantanee ale conținutului tabelului pg_stat_statements bazei de date țintă.

Raportarea propriu-zisă

Folosind interogări simple, se pot obține rapoarte destul de utile și interesante.

Datele agregate pentru intervalul de timp specificat

Interogare

SELECT 
  database_id , 
  SUM(calls) AS calls ,SUM(total_time)  AS total_time ,
  SUM(rows) AS rows , SUM(shared_blks_hit)  AS shared_blks_hit,
  SUM(shared_blks_read) AS shared_blks_read ,
  SUM(shared_blks_dirtied) AS shared_blks_dirtied,
  SUM(shared_blks_written) AS shared_blks_written , 
  SUM(local_blks_hit) AS local_blks_hit , 
  SUM(local_blks_read) AS local_blks_read , 
  SUM(local_blks_dirtied) AS local_blks_dirtied , 
  SUM(local_blks_written)  AS local_blks_written,
  SUM(temp_blks_read) AS temp_blks_read, 
  SUM(temp_blks_written) AS temp_blks_written , 
  SUM(blk_read_time) AS blk_read_time , 
  SUM(blk_write_time) AS blk_write_time
FROM 
  pg_stat_history
WHERE 
  queryid IS NULL AND
  database_id = DATABASE_ID  AND
  snapshot_timestamp BETWEEN BEGIN_TIMEPOINT AND END_TIMEPOINT
GROUP BY database_id ;

Timp DB

to_char(interval ‘1 millisecond’ * pg_total_stat_history_rec.total_time, ‘HH24:MI:SS.MS’)

Timp I/O

to_char(interval ‘1 millisecond’ * ( pg_total_stat_history_rec.blk_read_time + pg_total_stat_history_rec.blk_write_time ), ‘HH24:MI:SS.MS’)

TOP10 SQL după total_time

Interogare

SELECT 
  queryid , 
  SUM(calls) AS calls ,
  SUM(total_time)  AS total_time  	
FROM 
  pg_stat_history
WHERE 
  queryid IS NOT NULL AND 
  database_id = DATABASE_ID AND
  snapshot_timestamp BETWEEN BEGIN_TIMEPOINT AND END_TIMEPOINT 
GROUP BY queryid 
ORDER BY 3 DESC 
LIMIT 10
-------------------------------------------------------------------------------------
| TOP10 SQL DUPĂ TIMPUL TOTAL DE EXECUȚIE
|   #|    queryid|      calls|    procente apeluri|                total_time (ms) |  procente timp db
+----+-----------+-----------+-----------+--------------------------------+----------
|   1|  821760255|          2|     .00001|00:03:23.141(    203141.681 ms.)|      5.42
|   2| 4152624390|          2|     .00001|00:03:13.929(    193929.215 ms.)|      5.17
|   3| 1484454471|          4|     .00001|00:02:09.129(    129129.057 ms.)|      3.44
|   4|  655729273|          1|     .00000|00:02:01.869(    121869.981 ms.)|      3.25
|   5| 2460318461|          1|     .00000|00:01:33.113(     93113.835 ms.)|      2.48
|   6| 2194493487|          4|     .00001|00:00:17.377(     17377.868 ms.)|       .46
|   7| 1053044345|          1|     .00000|00:00:06.156(      6156.352 ms.)|       .16
|   8| 3644780286|          1|     .00000|00:00:01.063(      1063.830 ms.)|       .03

TOP10 SQL după timpul total I/O

Interogare

SELECT 
  queryid , 
  SUM(calls) AS calls ,
  SUM(blk_read_time + blk_write_time)  AS io_time
FROM 
  pg_stat_history
WHERE 
  queryid IS NOT NULL AND 
  database_id = DATABASE_ID  AND
  snapshot_timestamp BETWEEN BEGIN_TIMEPOINT AND END_TIMEPOINT
GROUP BY  queryid 
ORDER BY 3 DESC 
LIMIT 10
----------------------------------------------------------------------------------------
| TOP10 SQL DUPĂ TIMPUL TOTAL I/O
|   #|    queryid|      apeluri|    procent apeluri|                   Timp I/O (ms)|% timp I/O db
+----+-----------+-----------+-----------+--------------------------------+-------------
|   1| 4152624390|          2|     .00001|00:08:31.616(    511616.592 ms.)|        31.06
|   2|  821760255|          2|     .00001|00:08:27.099(    507099.036 ms.)|        30.78
|   3|  655729273|          1|     .00000|00:05:02.209(    302209.137 ms.)|        18.35
|   4| 2460318461|          1|     .00000|00:04:05.981(    245981.117 ms.)|        14.93
|   5| 1484454471|          4|     .00001|00:00:39.144(     39144.221 ms.)|         2.38
|   6| 2194493487|          4|     .00001|00:00:18.182(     18182.816 ms.)|         1.10
|   7| 1053044345|          1|     .00000|00:00:16.611(     16611.722 ms.)|         1.01
|   8| 3644780286|          1|     .00000|00:00:00.436(       436.205 ms.)|          .03

TOP10 SQL după timpul maxim de execuție

Interogare

SELECT 
  id AS snapshotid , 
  queryid , 
  snapshot_timestamp ,  
  max_time 
FROM 
  pg_stat_history 
WHERE 
  queryid IS NOT NULL AND 
  database_id = DATABASE_ID  AND
  snapshot_timestamp BETWEEN BEGIN_TIMEPOINT AND END_TIMEPOINT
ORDER BY 4 DESC 
LIMIT 10

-----------------------------------------------------------------------------------------
| TOP10 SQL DUPĂ TIMPUL MAXIM DE EXECUȚIE
|   #|          snapshot| snapshotID|    queryid|                           max_time (ms)
+----+------------------+-----------+-----------+----------------------------------------
|   1|  05.04.2019 01:03|       4169|  655729273|        00:02:01.869(    121869.981 ms.)
|   2|  04.04.2019 17:00|       4153|  821760255|        00:01:41.570(    101570.841 ms.)
|   3|  04.04.2019 16:00|       4146|  821760255|        00:01:41.570(    101570.841 ms.)
|   4|  04.04.2019 16:00|       4144| 4152624390|        00:01:36.964(     96964.607 ms.)
|   5|  04.04.2019 17:00|       4151| 4152624390|        00:01:36.964(     96964.607 ms.)
|   6|  05.04.2019 10:00|       4188| 1484454471|        00:01:33.452(     93452.150 ms.)
|   7|  04.04.2019 17:00|       4150| 2460318461|        00:01:33.113(     93113.835 ms.)
|   8|  04.04.2019 15:00|       4140| 1484454471|        00:00:11.892(     11892.302 ms.)
|   9|  04.04.2019 16:00|       4145| 1484454471|        00:00:11.892(     11892.302 ms.)
|  10|  04.04.2019 17:00|       4152| 1484454471|        00:00:11.892(     11892.302 ms.)

TOP10 SQL după citirea/scrierea BUFFER-ULUI ÎMPĂRTĂȘIT

Interogare

SELECT 
  id AS snapshotid , 
  queryid ,
  snapshot_timestamp , 
  shared_blks_read , 
  shared_blks_written 
FROM 
  pg_stat_history
WHERE 
  queryid IS NOT NULL AND 
  database_id = DATABASE_ID  AND
  snapshot_timestamp BETWEEN BEGIN_TIMEPOINT AND END_TIMEPOINT AND
  ( shared_blks_read > 0 OR shared_blks_written > 0 )
ORDER BY 4 DESC  , 5 DESC 
LIMIT 10
--------------------------------------------------------------------------------------------
| TOP10 SQL ÎN FUNCTIE DE CITIRE/ SCRIERE BUFFER COMPARTIMENTAT
|   #|          instantaneu| snapshotID|    queryid|   blocuri partajate citite|  blocuri partajate scrise
+----+------------------+-----------+-----------+---------------------+---------------------
|   1|  04.04.2019 17:00|       4153|  821760255|               797308|                    0
|   2|  04.04.2019 16:00|       4146|  821760255|               797308|                    0
|   3|  05.04.2019 01:03|       4169|  655729273|               797158|                    0
|   4|  04.04.2019 16:00|       4144| 4152624390|               756514|                    0
|   5|  04.04.2019 17:00|       4151| 4152624390|               756514|                    0
|   6|  04.04.2019 17:00|       4150| 2460318461|               734117|                    0
|   7|  04.04.2019 17:00|       4155| 3644780286|                52973|                    0
|   8|  05.04.2019 01:03|       4168| 1053044345|                52818|                    0
|   9|  04.04.2019 15:00|       4141| 2194493487|                52813|                    0
|  10|  04.04.2019 16:00|       4147| 2194493487|                52813|                    0
--------------------------------------------------------------------------------------------

Histograma distribuției cererilor în funcție de timpul maxim de execuție

Cererile

SELECT  
  MIN(max_time) AS hist_min  , 
  MAX(max_time) AS hist_max , 
  (( MAX(max_time) - MIN(min_time) ) / hist_columns ) as hist_width
FROM 
  pg_stat_history 
WHERE 
  queryid IS NOT NULL AND
  database_id = DATABASE_ID  AND
  snapshot_timestamp BETWEEN BEGIN_TIMEPOINT AND END_TIMEPOINT ;

SELECT 
  SUM(calls) AS calls
FROM 
  pg_stat_history 
WHERE 
  queryid IS NOT NULL AND
  database_id = DATABASE_ID  AND
  snapshot_timestamp BETWEEN BEGIN_TIMEPOINT AND END_TIMEPOINT AND 
  ( max_time >= hist_current_min AND  max_time < hist_current_max ) ;
|-----------------------------------------------------------------------------------------------
| HISTOGRAMĂ MAX_TIME
| TOTAL CERERI : 33851920
| TIMP MINIM  : 00:00:01.063
| TIMP MAXIM  : 00:02:01.869
---------------------------------------------------------------------------------
|                      durata minimă|                      durata maximă|     cereri
+----------------------------------+----------------------------------+----------
| 00:00:01.063(      1063.830 ms.) | 00:00:13.144(     13144.445 ms.) | 9
| 00:00:13.144(     13144.445 ms.) | 00:00:25.225(     25225.060 ms.) | 0
| 00:00:25.225(     25225.060 ms.) | 00:00:37.305(     37305.675 ms.) | 0
| 00:00:37.305(     37305.675 ms.) | 00:00:49.386(     49386.290 ms.) | 0
| 00:00:49.386(     49386.290 ms.) | 00:01:01.466(     61466.906 ms.) | 0
| 00:01:01.466(     61466.906 ms.) | 00:01:13.547(     73547.521 ms.) | 0
| 00:01:13.547(     73547.521 ms.) | 00:01:25.628(     85628.136 ms.) | 0
| 00:01:25.628(     85628.136 ms.) | 00:01:37.708(     97708.751 ms.) | 4
| 00:01:37.708(     97708.751 ms.) | 00:01:49.789(    109789.366 ms.) | 2
| 00:01:49.789(    109789.366 ms.) | 00:02:01.869(    121869.981 ms.) | 0

TOP10 Instantanee în funcție de Cereri pe secundă

Cererile

--pg_qps.sql
--Calculează Query Per Second 
CREATE OR REPLACE FUNCTION pg_qps( pg_stat_history_id integer ) RETURNS double precision AS $$
DECLARE
 pg_stat_history_rec record ;
 prev_pg_stat_history_id integer ;
 prev_pg_stat_history_rec record;
 total_seconds double precision ;
 result double precision;
BEGIN 
  result = 0 ;
  
  SELECT *
  INTO pg_stat_history_rec
  FROM 
    pg_stat_history
  WHERE id = pg_stat_history_id ;

  IF pg_stat_history_rec.snapshot_timestamp IS NULL 
  THEN
    RAISE EXCEPTION 'EROARE - pg_stat_history nu a fost găsit pentru id = %',pg_stat_history_id;
  END IF ;  
  
 --RAISE NOTICE 'pg_stat_history_id = % , snapshot_timestamp = %', pg_stat_history_id , 
 pg_stat_history_rec.snapshot_timestamp ;
  
  SELECT 
    MAX(id)   
  INTO
    prev_pg_stat_history_id
  FROM
    pg_stat_history
  WHERE 
    database_id = pg_stat_history_rec.database_id AND
	queryid IS NULL AND
	id  0 
  THEN
    result = pg_stat_history_rec.calls / total_seconds ;
  ELSE
   result = 0 ; 
  END IF;
   
 RETURN result ;
END
$$ LANGUAGE plpgsql;


SELECT 
  id , 
  snapshot_timestamp ,
  calls , 	
  total_time , 
  ( select pg_qps( id )) AS QPS ,
  blk_read_time ,
  blk_write_time
FROM 
  pg_stat_history
WHERE 
  queryid IS NULL AND 
  database_id = DATABASE_ID  AND
  snapshot_timestamp BETWEEN BEGIN_TIMEPOINT AND END_TIMEPOINT AND
  ( select pg_qps( id )) IS NOT NULL 
ORDER BY 5 DESC 
LIMIT 10
|-----------------------------------------------------------------------------------------------
| TOP10 Snapshots ordonate după numărul de QueryPerSeconds
-----------------------------------------------------------------------------------------------------------------------------------------------
|    #|          snapshot| snapshotID|      apeluri|                      timp total db|        QPS|                          timp I/O| I/O time %
+-----+------------------+-----------+-----------+----------------------------------+-----------+----------------------------------+-----------
|    1|  04.04.2019 20:04|       4161|    5758631|  00:06:30.513(    390513.926 ms.)|   1573.396|  00:00:01.470(      1470.110 ms.)|       .376
|    2|  04.04.2019 17:00|       4149|    3529197|  00:11:48.830(    708830.618 ms.)|    980.332|  00:12:47.834(    767834.052 ms.)|    108.324
|    3|  04.04.2019 16:00|       4143|    3525360|  00:10:13.492(    613492.351 ms.)|    979.267|  00:08:41.396(    521396.555 ms.)|     84.988
|    4|  04.04.2019 21:03|       4163|    2781536|  00:03:06.470(    186470.979 ms.)|    785.745|  00:00:00.249(       249.865 ms.)|       .134
|    5|  04.04.2019 19:03|       4159|    2890362|  00:03:16.784(    196784.755 ms.)|    776.979|  00:00:01.441(      1441.386 ms.)|       .732
|    6|  04.04.2019 14:00|       4137|    2397326|  00:04:43.033(    283033.854 ms.)|    665.924|  00:00:00.024(        24.505 ms.)|       .009
|    7|  04.04.2019 15:00|       4139|    2394416|  00:04:51.435(    291435.010 ms.)|    665.116|  00:00:12.025(     12025.895 ms.)|      4.126
|    8|  04.04.2019 13:00|       4135|    2373043|  00:04:26.791(    266791.988 ms.)|    659.179|  00:00:00.064(        64.261 ms.)|       .024
|    9|  05.04.2019 01:03|       4167|    4387191|  00:06:51.380(    411380.293 ms.)|    609.332|  00:05:18.847(    318847.407 ms.)|     77.507
|   10|  04.04.2019 18:01|       4157|    1145596|  00:01:19.217(     79217.372 ms.)|    313.004|  00:00:01.319(      1319.676 ms.)|      1.666

Istoricul execuției pe oră cu QueryPerSeconds și timp I/O

Interogare

SELECT 
  id , 
  snapshot_timestamp ,
  apeluri , 	
  timp_total , 
  ( select pg_qps( id )) AS QPS ,
  blk_read_time ,
  blk_write_time
FROM 
  pg_stat_history
WHERE 
  queryid IS NULL AND 
  database_id = DATABASE_ID  AND
  snapshot_timestamp BETWEEN BEGIN_TIMEPOINT AND END_TIMEPOINT
ORDER BY 2
|-----------------------------------------------------------------------------------------------
| ISTORIC EXECUTIE ORARA CU QueryPerSeconds si Timp I/O
-----------------------------------------------------------------------------------------------------------------------------------------------
| ISTORIC QUERY PER SECUNDĂ
|    #|          instantaneu| idInstantaneu|      apeluri|                      timp total db|        QPS|                          timp I/O| % timp I/O
+-----+------------------+-----------+-----------+----------------------------------+-----------+----------------------------------+-----------
|    1|  04.04.2019 11:00|       4131|       3747|  00:00:00.835(       835.374 ms.)|      1.041|  00:00:00.000(          .000 ms.)|       .000
|    2|  04.04.2019 12:00|       4133|    1002722|  00:01:52.419(    112419.376 ms.)|    278.534|  00:00:00.149(       149.105 ms.)|       .133
|    3|  04.04.2019 13:00|       4135|    2373043|  00:04:26.791(    266791.988 ms.)|    659.179|  00:00:00.064(        64.261 ms.)|       .024
|    4|  04.04.2019 14:00|       4137|    2397326|  00:04:43.033(    283033.854 ms.)|    665.924|  00:00:00.024(        24.505 ms.)|       .009
|    5|  04.04.2019 15:00|       4139|    2394416|  00:04:51.435(    291435.010 ms.)|    665.116|  00:00:12.025(     12025.895 ms.)|      4.126
|    6|  04.04.2019 16:00|       4143|    3525360|  00:10:13.492(    613492.351 ms.)|    979.267|  00:08:41.396(    521396.555 ms.)|     84.988
|    7|  04.04.2019 17:00|       4149|    3529197|  00:11:48.830(    708830.618 ms.)|    980.332|  00:12:47.834(    767834.052 ms.)|    108.324
|    8|  04.04.2019 18:01|       4157|    1145596|  00:01:19.217(     79217.372 ms.)|    313.004|  00:00:01.319(      1319.676 ms.)|      1.666
|    9|  04.04.2019 19:03|       4159|    2890362|  00:03:16.784(    196784.755 ms.)|    776.979|  00:00:01.441(      1441.386 ms.)|       .732
|   10|  04.04.2019 20:04|       4161|    5758631|  00:06:30.513(    390513.926 ms.)|   1573.396|  00:00:01.470(      1470.110 ms.)|       .376
|   11|  04.04.2019 21:03|       4163|    2781536|  00:03:06.470(    186470.979 ms.)|    785.745|  00:00:00.249(       249.865 ms.)|       .134
|   12|  04.04.2019 23:03|       4165|    1443155|  00:01:34.467(     94467.539 ms.)|    200.438|  00:00:00.015(        15.287 ms.)|       .016
|   13|  05.04.2019 01:03|       4167|    4387191|  00:06:51.380(    411380.293 ms.)|    609.332|  00:05:18.847(    318847.407 ms.)|     77.507
|   14|  05.04.2019 02:03|       4171|     189852|  00:00:10.989(     10989.899 ms.)|     52.737|  00:00:00.539(       539.110 ms.)|      4.906
|   15|  05.04.2019 03:01|       4173|       3627|  00:00:00.103(       103.000 ms.)|      1.042|  00:00:00.004(         4.131 ms.)|      4.010
|   16|  05.04.2019 04:00|       4175|       3627|  00:00:00.085(        85.235 ms.)|      1.025|  00:00:00.003(         3.811 ms.)|      4.471
|   17|  05.04.2019 05:00|       4177|       3747|  00:00:00.849(       849.454 ms.)|      1.041|  00:00:00.006(         6.124 ms.)|       .721
|   18|  05.04.2019 06:00|       4179|       3747|  00:00:00.849(       849.561 ms.)|      1.041|  00:00:00.000(          .051 ms.)|       .006
|   19|  05.04.2019 07:00|       4181|       3747|  00:00:00.839(       839.416 ms.)|      1.041|  00:00:00.000(          .062 ms.)|       .007
|   20|  05.04.2019 08:00|       4183|       3747|  00:00:00.846(       846.382 ms.)|      1.041|  00:00:00.000(          .007 ms.)|       .001
|   21|  05.04.2019 09:00|       4185|       3747|  00:00:00.855(       855.426 ms.)|      1.041|  00:00:00.000(          .065 ms.)|       .008
|   22|  05.04.2019 10:00|       4187|       3797|  00:01:40.150(    100150.165 ms.)|      1.055|  00:00:21.845(     21845.217 ms.)|     21.812

Textul tuturor interogărilor SQL-select

Interogare

SELECT 
  queryid , 
  query 
FROM 
  pg_stat_history
WHERE 
  queryid IS NOT NULL AND 
  database_id = DATABASE_ID  AND
  snapshot_timestamp BETWEEN BEGIN_TIMEPOINT AND END_TIMEPOINT
GROUP BY queryid , query

Rezultatul

Așa cum se poate observa, prin metode destul de simple, se poate obține o cantitate semnificativă de informații utile despre încărcarea și starea bazei de date.

Observație:Dacă în interogări se înregistrează queryid, atunci vom obține istoricul pentru o interogare separată (pentru a economisi spațiu, rapoartele pentru interogările separate sunt omise).

Așadar, datele statistice despre performanța interogărilor sunt disponibile și sunt colectate.
Prima etapă „colectarea datelor statistice” s-a încheiat.

Putem trece la a doua etapă - „optimizarea metodelor de performanță”.
Monitorizarea performanței interogărilor PostgreSQL. Partea 1 — raportare

Dar aceasta este o poveste cu totul diferită.

Continuarea urmează...

Sursa: habr.com

Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS 🔥 Cumpără un hosting fiabil pentru site-uri cu protecție DDoS, servere VPS VDS | ProHoster